这项研究关注语言模型训练过程中一个反直觉现象:在间接宾语识别任务上,模型会经历一段准确率低于随机水平的窗口期,偏好重复出现的名字,而同期语言建模损失却持续下降。作者通过定位一组写入重复名字的注意力头,并将其最终输出替换为在非重复名字提示上的平均输出,在多个规模的Pythia模型上改善了正确与重复名字之间的对数几率差。研究发现,在160M模型中,成熟阶段负责压低重复名字的注意力头在早期几乎不发挥作用,其对重复提及的注意力占比不足百分之一,输出也几乎不直接降低该名字的几率,而这两项属性随行为恢复逐步增强。将成熟参数移植到早期检查点可恢复35%至68%的最终改进。类似早期到后期的反转也出现在其他规模及GPT-2、OLMo等模型中。这表明成熟回路可能掩盖了训练早期曾塑造行为的临时因果结构,提示机制可解释性研究需关注训练动态而非仅分析最终模型。
| 间接宾语识别 (Indirect Object Identification, IOI) | 一种语言模型任务,要求模型在句子中区分只出现一次的名字和重复出现的名字,并选择前者作为间接宾语。 |
| 机制可解释性 (Mechanistic Interpretability) | 通过分析模型内部组件(如注意力头)的计算来理解模型行为的研究领域。 |
| 注意力头 (Attention Head) | Transformer 模型中的基本计算单元,负责根据查询和键计算注意力权重并加权聚合值向量。 |
| logit 差 (Logit Difference) | 模型对两个候选 token 的未归一化对数概率之差,常用于衡量模型对特定选项的偏好程度。 |
| Pythia 模型 | 一套由 EleutherAI 发布的开源语言模型系列,包含多个规模,常用于可解释性研究。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅