优化器记忆竟成遗忘元凶!语言模型微调时旧答案概率持续下降
A Step Towards Forgetting: Optimiser History and the Loss of Answer Mass
arXiv CL (cs.CL) 重要 #灾难性遗忘#微调#优化器 🕐 今天 12:00

📖 AI 总结

这篇论文研究语言模型微调过程中的遗忘机制,核心发现是优化器的历史动量会加剧对旧任务知识的遗忘。作者将旧任务损失分解为答案间的混淆和概率泄漏两部分,在三个语言模型系列上观察到一致规律:旧答案的总概率质量持续下降,但模型对旧答案的区分能力通常反而提升,即模型仍能正确辨别答案,却越来越不愿输出它们。通过分解Adam更新,研究发现累积的历史梯度倾向于推动概率泄漏,而当前梯度则起抵制作用;按梯度新旧程度分析表明,有害贡献主要来自新任务的较旧梯度,近期梯度反而保护旧答案。重置动量的干预实验证实,存储的历史确实影响知识保留,且更长的Adam训练最终能通过恢复答案概率质量降低旧任务损失。该研究揭示了优化器记忆如何在当前梯度试图保留旧知识的同时侵蚀已学行为。

🔑 关键词速览

动量优化器中的一种技术,通过累积过去梯度的指数加权平均来加速训练并减少震荡。
Adam一种自适应学习率优化算法,结合了动量和RMSProp,广泛用于训练神经网络。
答案质量模型在旧任务答案集上分配的总概率质量,反映模型保留旧知识的能力。
灾难性遗忘神经网络在微调新任务时,性能在旧任务上显著下降的现象。
梯度损失函数相对于模型参数的导数,指示参数更新方向以最小化损失。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅