该论文针对在线策略蒸馏(OPD)框架中教师奖励与推理进展不一致的问题提出改进方案。作者观察到,教师奖励常因学生推理步骤偏离教师输出而低估其实际推理进展,导致监督信号失真。为此,他们提出R2-OPD方法,在轨迹内分别构建基于教师奖励和独立估计的进展奖励两套排序,当二者不一致时选择性抑制蒸馏奖励,从而减少与推理进展冲突的监督,同时保留有效的教师指导。实验表明,该方法在推理任务上较标准OPD有一致提升,尤其在复杂推理场景中效果显著。研究揭示了OPD中“模仿”与“推理进步”之间的张力,为语言模型后训练中的奖励设计提供了新思路。
| On-policy distillation (OPD) | 一种后训练框架,利用学生生成的轨迹和教师的密集监督来优化语言模型。 |
| Reasoning progress | 推理过程中逐步推进的逻辑进展,反映推理步骤的有效性。 |
| Reward filtering | 一种机制,通过选择性地抑制或调整奖励信号来优化训练过程。 |
| R2-OPD | 本文提出的方法,基于推理进展感知的奖励过滤,用于改进在线策略蒸馏。 |
| Trajectory | 模型生成的一系列推理步骤或输出序列,用于训练和评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅