🔥 今日值得一读 教师带学生反被拖累?新方法SCOUT让蒸馏效果飙升!
On the Off-Policy Teacher in On-Policy Distillation
arXiv LG (cs.LG) 🔥 重点 #知识蒸馏#后训练#LLM 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做模型蒸馏时,帮你理解教师模型为何在学生轨迹上表现不佳,指导蒸馏策略设计。

📖 AI 总结

本文研究在线策略蒸馏(OPD)中的一个基础性矛盾:学生模型基于自身策略生成轨迹并接受教师模型的密集监督,但这些轨迹对学生是在线策略,对教师却是离线策略。教师模型通常只擅长续写由自身策略生成的文本前缀,面对学生生成的前缀时,其续写能力会随前缀变长而下降。为此,作者提出SCOUT框架,在标准OPD更新之外,定期用可验证奖励的强化学习优化教师模型,使其从学生前缀出发生成续写并从结果奖励中学习,从而适应学生生成的前缀。实验表明,SCOUT能有效提升教师对学生前缀的续写能力,并在多种师生配置、模型规模和推理任务上稳定提升在线策略蒸馏的效果。该工作揭示了OPD中被忽视的教师侧失配问题,为蒸馏范式的改进提供了新思路。

🔑 关键词速览

On-policy distillation (OPD)在线策略蒸馏,一种后训练范式,学生从自身策略生成的轨迹中接受教师的密集监督。
Off-policy teacher离线策略教师,指教师模型在蒸馏过程中需要监督非自身策略生成的前缀,导致性能下降。
Student-COnditioned Updates of the Teacher (SCOUT)学生条件化的教师更新,一种协同训练框架,通过强化学习使教师适应学生生成的前缀。
Reinforcement learning with verifiable rewards带有可验证奖励的强化学习,一种利用可验证的结果奖励来优化模型条件生成能力的方法。
Teacher-student configurations教师-学生配置,指不同规模和类型的教师与学生模型组合,用于评估蒸馏方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅