🔥 今日值得一读 教师门控蒸馏新招:提示级验证把关,GPU利用率从9.8%飙到78.9%!
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
arXiv LG (cs.LG) 🔥 重点 #知识蒸馏#训练方法#LLM 🕐 09-04 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法在蒸馏时过滤不可靠教师输出,避免错误引导,提升学生模型在复杂任务上的准确性和鲁棒性。

📖 AI 总结

该论文提出了一种名为“教师门控式在线策略蒸馏”(TGOPD)的新方法,旨在解决在线策略蒸馏(OPD)中教师模型可能对某些提示给出错误但自信的监督信号的问题。传统OPD对所有提示统一应用密集监督,而TGOPD的核心创新在于:在分配监督前,先通过少量验证器评分的教师探针,在提示层面验证教师可靠性。通过可靠性检查的提示使用密集OPD,未通过的则转向基于验证器的GRPO方法。实验覆盖4B和35B规模学生模型,在数学、代码和指令遵循的六个单领域场景中,TGOPD均优于传统OPD,并在多领域训练中取得更高平均基准分数。此外,该方法利用原本闲置的教师计算能力进行可靠性评估,将异步OPD中教师节点GPU利用率从9.8%提升至78.9%,显著减少了计算资源浪费。

🔑 关键词速览

On-policy Distillation (OPD)一种蒸馏方法,教师模型在学生的自生成轨迹上提供密集的令牌级监督,以加速后训练。
Teacher-Gated On-Policy Distillation (TGOPD)一种改进的OPD方法,在提示级别验证教师可靠性,并据此决定使用密集OPD或验证器基础的GRPO。
Reverse KL一种散度度量,用于衡量分布差异,具有模式寻求特性,可能导致模型忽略低概率区域。
GRPO一种强化学习优化算法,可能基于组相对策略优化,用于在教师不可靠时进行训练。
Verifier一种评估模型输出正确性的工具或模型,用于验证教师响应的可靠性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅