🔥 今日值得一读 219M模型四任务损失从2.927降到1.114,CAGD让语言模型持续学习不再遗忘!
Stabilizing language models under continual learning via condition-anchored distillation
arXiv CL (cs.CL) 🔥 重点 #持续学习#知识蒸馏#灾难性遗忘 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
持续微调模型时可用少量旧提示锚定旧行为,防止新任务训练破坏已有能力。

📖 AI 总结

本文研究语言模型在持续学习中的稳定性问题,提出条件锚定生成蒸馏(CAGD)方法。该方法保留少量旧提示,利用冻结的旧模型重建生成结果与生成状态,并在学习新任务时匹配其预测分布,从而将普通回放中混淆的三种角色分离:条件选择需保护的行为,教师生成定位相关状态,软目标规定预测可变化的方式。在219M掩码扩散语言模型的四任务持续适应中,CAGD将最终留出损失从2.927降至1.114,反向任务顺序下从2.168降至0.891;在教师生成支持相同的情况下,软目标比硬回放平均损失低0.055。该方向在SMDM和Qwen3的新事实与自然指令上保持一致,但GSM8K上Qwen的精确匹配保留在0.6B时受随机种子影响,1.7B时进一步恶化。研究支持条件锚定的功能保持作为语言生成目标中的通用设计原则。

🔑 关键词速览

条件锚定生成蒸馏 (CAGD)一种持续学习方法,通过保留旧提示并利用冻结的先前模型来匹配预测分布,从而保护已学行为。
掩码扩散语言模型 (SMDM)一种使用掩码扩散过程进行语言生成的模型,通过逐步去噪生成文本。
教师展开蒸馏在自回归生成中,使用教师模型生成的序列进行蒸馏,允许序列散度的精确分解。
软目标在蒸馏中使用的概率分布目标,允许预测以软性方式变化,而非硬性约束。
持续学习模型按顺序学习多个任务而不遗忘先前任务知识的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅