本文研究在线策略蒸馏(OPD)中的一个基础性矛盾:学生模型基于自身策略生成轨迹并接受教师模型的密集监督,但这些轨迹对学生是在线策略,对教师却是离线策略。教师模型通常只擅长续写由自身策略生成的文本前缀,面对学生生成的前缀时,其续写能力会随前缀变长而下降。为此,作者提出SCOUT框架,在标准OPD更新之外,定期用可验证奖励的强化学习优化教师模型,使其从学生前缀出发生成续写并从结果奖励中学习,从而适应学生生成的前缀。实验表明,SCOUT能有效提升教师对学生前缀的续写能力,并在多种师生配置、模型规模和推理任务上稳定提升在线策略蒸馏的效果。该工作揭示了OPD中被忽视的教师侧失配问题,为蒸馏范式的改进提供了新思路。
| On-policy distillation (OPD) | 在线策略蒸馏,一种后训练范式,学生从自身策略生成的轨迹中接受教师的密集监督。 |
| Off-policy teacher | 离线策略教师,指教师模型在蒸馏过程中需要监督非自身策略生成的前缀,导致性能下降。 |
| Student-COnditioned Updates of the Teacher (SCOUT) | 学生条件化的教师更新,一种协同训练框架,通过强化学习使教师适应学生生成的前缀。 |
| Reinforcement learning with verifiable rewards | 带有可验证奖励的强化学习,一种利用可验证的结果奖励来优化模型条件生成能力的方法。 |
| Teacher-student configurations | 教师-学生配置,指不同规模和类型的教师与学生模型组合,用于评估蒸馏方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅