微调大模型内部表示变化与关键组件竟不相关,任务重叠反致性能下降!
Decoupling Internal Representational Changes and Causal Importance in Fine-Tuned Large Language Models
arXiv AI (cs.AI) 重要 大模型可解释性论文方法 🕐 今天 12:00

📖 AI 总结

该研究探讨了微调如何改变大语言模型的内部机制。作者分析了微调对注意力模式和逐层激活等内部表征的影响,并考察这些变化是否与EAP方法识别出的、驱动任务表现的关键组件(如注意力头和logit级激活)相关联。研究发现,EAP识别的组件集中在特定层,表明模型在内化任务行为时存在一定程度的功能局部化;但这些组件的层级分布与微调期间表征变化最大的层基本不相关。此外,不同任务间EAP组件的重叠并不能带来跨任务性能迁移,尤其当任务性质差异较大时(如分类与生成任务)。更值得注意的是,当一个任务与另一任务在EAP组件上高度重叠时,微调反而可能导致后者性能下降。该工作揭示了内部表征变化与因果重要性之间的解耦现象,为理解微调机制及多任务适配提供了新视角。

🔑 关键词速览

Fine-tuning微调,指在预训练大语言模型基础上,使用特定下游任务数据继续训练以适配该任务的过程。
EAP一种识别任务相关组件(如注意力头、logit级激活)的方法,用于定位驱动任务性能的关键内部单元。
Attention patterns注意力模式,指模型在处理输入时各注意力头分配的权重分布,反映模型关注哪些位置的信息。
Layer-wise activations逐层激活,指模型每一层神经元或表示单元的输出值,用于分析不同层对任务的贡献。
Functional localisation功能局部化,指特定功能或任务相关计算集中在模型的某些特定层或组件中的现象。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅