本文针对循环语言模型(LoopLM)后训练困难的问题,提出了跨循环在线策略蒸馏框架 LoopOPD。该框架利用模型自身额外的循环计算作为监督来源,以冻结的终端循环策略作为"计算特权教师",对中间循环的学生模型在自生成轨迹上进行密集监督,无需外部教师或特权信息。在此基础上,作者进一步提出动态版本 D-LoopOPD,随着共享参数更新持续刷新终端循环教师,实现循环式自我改进。研究还刻画了蒸馏更新在循环深度间的传播机制,并推导出单次更新即可在两个循环深度上同时实现局部改进的充分条件。在 Ouro-Thinking 模型上的实验表明,LoopOPD 提升了数学推理能力,D-LoopOPD 通过动态教师更新带来进一步增益;且仅在数学数据上训练,模型在通用推理和代码生成基准上也获得提升,说明循环计算可作为 LoopLM 的有效监督来源。
| Looped Language Models (LoopLMs) | 循环语言模型,通过重复使用共享参数进行多步循环计算来扩展推理能力,实现参数高效。 |
| On-Policy Distillation | 在线策略蒸馏,一种知识蒸馏方法,学生模型在自身生成的轨迹上接受教师模型的指导。 |
| Cross-Loop Distillation | 跨循环蒸馏,利用模型内部不同循环深度的计算作为监督信号进行蒸馏。 |
| Dynamic LoopOPD (D-LoopOPD) | 动态LoopOPD,在训练过程中不断更新终端循环教师,实现循环自我改进的框架。 |
| Compute Privileged Teacher | 计算特权教师,指在推理时使用更多计算资源(如更多循环步骤)的模型版本,用于指导学生模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅