🔥 今日值得一读 推理蒸馏翻车?新方法专治“老师乱打分”,推理性能再涨一截!
Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress
arXiv AI (cs.AI) 🔥 重点 #蒸馏#训练方法#推理优化 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
改进在线策略蒸馏,按推理进展过滤教师反馈,避免无效监督,提升语言模型后训练效率。

📖 AI 总结

该论文针对在线策略蒸馏(OPD)框架中教师奖励与推理进展不一致的问题提出改进方案。作者观察到,教师奖励常因学生推理步骤偏离教师输出而低估其实际推理进展,导致监督信号失真。为此,他们提出R2-OPD方法,在轨迹内分别构建基于教师奖励和独立估计的进展奖励两套排序,当二者不一致时选择性抑制蒸馏奖励,从而减少与推理进展冲突的监督,同时保留有效的教师指导。实验表明,该方法在推理任务上较标准OPD有一致提升,尤其在复杂推理场景中效果显著。研究揭示了OPD中“模仿”与“推理进步”之间的张力,为语言模型后训练中的奖励设计提供了新思路。

🔑 关键词速览

On-policy distillation (OPD)一种后训练框架,利用学生生成的轨迹和教师的密集监督来优化语言模型。
Reasoning progress推理过程中逐步推进的逻辑进展,反映推理步骤的有效性。
Reward filtering一种机制,通过选择性地抑制或调整奖励信号来优化训练过程。
R2-OPD本文提出的方法,基于推理进展感知的奖励过滤,用于改进在线策略蒸馏。
Trajectory模型生成的一系列推理步骤或输出序列,用于训练和评估。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅