语言模型训练早期竟偏爱重复名字,准确率跌破50%!
Copying Before Suppression: What Drives a Below-Chance Dip During Language Model Training?
arXiv CL (cs.CL) 重要 #可解释性#训练动力学#机制分析 🕐 今天 12:00

📖 AI 总结

这项研究关注语言模型训练过程中一个反直觉现象:在间接宾语识别任务上,模型会经历一段准确率低于随机水平的窗口期,偏好重复出现的名字,而同期语言建模损失却持续下降。作者通过定位一组写入重复名字的注意力头,并将其最终输出替换为在非重复名字提示上的平均输出,在多个规模的Pythia模型上改善了正确与重复名字之间的对数几率差。研究发现,在160M模型中,成熟阶段负责压低重复名字的注意力头在早期几乎不发挥作用,其对重复提及的注意力占比不足百分之一,输出也几乎不直接降低该名字的几率,而这两项属性随行为恢复逐步增强。将成熟参数移植到早期检查点可恢复35%至68%的最终改进。类似早期到后期的反转也出现在其他规模及GPT-2、OLMo等模型中。这表明成熟回路可能掩盖了训练早期曾塑造行为的临时因果结构,提示机制可解释性研究需关注训练动态而非仅分析最终模型。

🔑 关键词速览

间接宾语识别 (Indirect Object Identification, IOI)一种语言模型任务,要求模型在句子中区分只出现一次的名字和重复出现的名字,并选择前者作为间接宾语。
机制可解释性 (Mechanistic Interpretability)通过分析模型内部组件(如注意力头)的计算来理解模型行为的研究领域。
注意力头 (Attention Head)Transformer 模型中的基本计算单元,负责根据查询和键计算注意力权重并加权聚合值向量。
logit 差 (Logit Difference)模型对两个候选 token 的未归一化对数概率之差,常用于衡量模型对特定选项的偏好程度。
Pythia 模型一套由 EleutherAI 发布的开源语言模型系列,包含多个规模,常用于可解释性研究。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅