自蒸馏白忙一场?正确参考竟不如随机问题!
Rethinking Privileged Information in On-Policy Self-Distillation
arXiv LG (cs.LG) 重要 #自蒸馏#强化学习#推理行为 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
重新审视在线策略自蒸馏中的特权信息作用,区分性能提升源于信息学习还是推理行为恢复,指导训练策略设计。

📖 AI 总结

这篇论文重新审视了在线策略自蒸馏(OPSD)中特权参考信息的作用。作者在科学和数学数据集上,使用1.7B至8B的Qwen3模型进行实验,通过分析框架分离参考信息与无参考教师监督的影响。研究发现,正确的参考并未在不同生成模式、模型规模和数据集上带来一致的性能提升;学生即使没有正确参考也能改进,甚至其他问题的解决方案在数学推理基准上表现更优。学生的预测更贴近基础模型的思考行为,而非参考信息引发的监督,但其他问题构建的对照组也能复现大部分对齐效果。此外,更强的对齐并不必然对应更大的性能收益。结论指出,仅凭性能提升和分布对齐无法确定特权参考信息在OPSD学习中的具体贡献,这挑战了现有对自蒸馏机制的理解。

🔑 关键词速览

On-policy self-distillation (OPSD)在线策略自蒸馏,一种训练方法,学生模型基于自身输出并利用同一模型提供的监督进行学习。
Privileged reference information特权参考信息,在训练过程中提供给模型的额外正确或参考信息,用于指导学习。
Token-level supervision令牌级监督,在序列生成的每个令牌级别上提供的训练信号。
Qwen3一种大型语言模型系列,由阿里巴巴开发,用于自然语言处理任务。
Distributional alignment分布一致性,衡量模型预测分布与某种参考分布之间的相似程度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅