本文研究语言模型在持续学习中的稳定性问题,提出条件锚定生成蒸馏(CAGD)方法。该方法保留少量旧提示,利用冻结的旧模型重建生成结果与生成状态,并在学习新任务时匹配其预测分布,从而将普通回放中混淆的三种角色分离:条件选择需保护的行为,教师生成定位相关状态,软目标规定预测可变化的方式。在219M掩码扩散语言模型的四任务持续适应中,CAGD将最终留出损失从2.927降至1.114,反向任务顺序下从2.168降至0.891;在教师生成支持相同的情况下,软目标比硬回放平均损失低0.055。该方向在SMDM和Qwen3的新事实与自然指令上保持一致,但GSM8K上Qwen的精确匹配保留在0.6B时受随机种子影响,1.7B时进一步恶化。研究支持条件锚定的功能保持作为语言生成目标中的通用设计原则。
| 条件锚定生成蒸馏 (CAGD) | 一种持续学习方法,通过保留旧提示并利用冻结的先前模型来匹配预测分布,从而保护已学行为。 |
| 掩码扩散语言模型 (SMDM) | 一种使用掩码扩散过程进行语言生成的模型,通过逐步去噪生成文本。 |
| 教师展开蒸馏 | 在自回归生成中,使用教师模型生成的序列进行蒸馏,允许序列散度的精确分解。 |
| 软目标 | 在蒸馏中使用的概率分布目标,允许预测以软性方式变化,而非硬性约束。 |
| 持续学习 | 模型按顺序学习多个任务而不遗忘先前任务知识的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅