该研究探讨了大型语言模型在微调过程中上下文学习能力退化的问题,并质疑了以注意力变化作为保留该能力代理指标的有效性。作者提出了两个量化指标:注意力层面的“上下文敏感性”和行为层面的“ICL-GAP”准确率差距。通过在Llama-2-7B上进行的四组消融实验发现,当优化注意力敏感性指标时,该指标可接近理论上限,但行为层面的上下文学习能力并未相应提升,同时模型在MMLU基准上的准确率显著下降,呈现出典型的Goodhart效应。进一步分析表明,注意力被引导至格式和示例内容而非标签信息,导致代理指标失真。研究结论强调,注意力层面的代理指标必须经过行为验证才能作为训练优化目标,这一发现对模型微调策略的设计具有重要警示意义。
| In-Context Learning (ICL) | 上下文学习,指大语言模型根据提供的示例自动适应新任务的能力。 |
| In-Context Sensitivity (ICS) | 上下文敏感性,衡量匹配与不匹配演示前缀下最后一个令牌注意力分布的平均差异。 |
| ICL-GAP | 行为准确性差距,比较相同前缀下模型行为准确率的差异,用于评估实际ICL表现。 |
| Goodhart dissociation | 古德哈特解离,指优化代理指标时,该指标不再反映真实目标的现象。 |
| MMLU | 大规模多任务语言理解基准,用于评估语言模型的知识和推理能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅