该论文提出了一种名为“教师门控式在线策略蒸馏”(TGOPD)的新方法,旨在解决在线策略蒸馏(OPD)中教师模型可能对某些提示给出错误但自信的监督信号的问题。传统OPD对所有提示统一应用密集监督,而TGOPD的核心创新在于:在分配监督前,先通过少量验证器评分的教师探针,在提示层面验证教师可靠性。通过可靠性检查的提示使用密集OPD,未通过的则转向基于验证器的GRPO方法。实验覆盖4B和35B规模学生模型,在数学、代码和指令遵循的六个单领域场景中,TGOPD均优于传统OPD,并在多领域训练中取得更高平均基准分数。此外,该方法利用原本闲置的教师计算能力进行可靠性评估,将异步OPD中教师节点GPU利用率从9.8%提升至78.9%,显著减少了计算资源浪费。
| On-policy Distillation (OPD) | 一种蒸馏方法,教师模型在学生的自生成轨迹上提供密集的令牌级监督,以加速后训练。 |
| Teacher-Gated On-Policy Distillation (TGOPD) | 一种改进的OPD方法,在提示级别验证教师可靠性,并据此决定使用密集OPD或验证器基础的GRPO。 |
| Reverse KL | 一种散度度量,用于衡量分布差异,具有模式寻求特性,可能导致模型忽略低概率区域。 |
| GRPO | 一种强化学习优化算法,可能基于组相对策略优化,用于在教师不可靠时进行训练。 |
| Verifier | 一种评估模型输出正确性的工具或模型,用于验证教师响应的可靠性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅