该研究指出,Transformer残差流的语料均值方向并非可忽略的冗余成分,而是MLP门控群体设定工作点的功能性参考基准。在Phi-2中,中层堆叠的静息门控预激活分解显示,超过99.9%门控的静息抑制由耦合项w·b_L承载,其强度达显式偏置参数的48至56倍,且具有方向特异性:随机方向对群体放电率的排序相关性不超过0.09,而参考方向可达0.95。因果实验表明,移除流在参考方向上的投影会使超阈值放电增加约9倍,呈剂量单调性,为范数匹配对照的23至59倍;沿参考方向注入噪声的代价是随机方向的8至42倍。该分解在另外四个模型家族中复现,八模型扫描显示机制普遍存在于GELU与SiLU家族,仅在OPT中因LayerNorm偏置抵消而缺失。这表明门控阈值实质是对网络为所读分布构建的常量的耦合,偏置参数贡献甚微,而该常量在流与参数间的分配取决于架构。
| 残差流 (residual stream) | Transformer中逐层累加信息的核心通道,各子层(注意力、MLP)的输出都加回该流中。 |
| MLP门控 (MLP gate) | 前馈网络中的门控单元,决定神经元是否激活,常见形式有GELU和SwiGLU。 |
| 语料均值方向 (corpus-mean direction) | 残差流在所有输入上的平均向量,通常被视为需要去除的偏置,但本文认为它具有功能作用。 |
| 预激活 (pre-activation) | 门控单元在应用非线性激活函数之前的线性加权和,其静息值决定门控的初始状态。 |
| 剂量响应 (dose-response) | 描述干预强度(如移除投影的比例)与效应大小(如放电率变化)之间关系的实验范式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅