这篇论文重新审视了在线策略自蒸馏(OPSD)中特权参考信息的作用。作者在科学和数学数据集上,使用1.7B至8B的Qwen3模型进行实验,通过分析框架分离参考信息与无参考教师监督的影响。研究发现,正确的参考并未在不同生成模式、模型规模和数据集上带来一致的性能提升;学生即使没有正确参考也能改进,甚至其他问题的解决方案在数学推理基准上表现更优。学生的预测更贴近基础模型的思考行为,而非参考信息引发的监督,但其他问题构建的对照组也能复现大部分对齐效果。此外,更强的对齐并不必然对应更大的性能收益。结论指出,仅凭性能提升和分布对齐无法确定特权参考信息在OPSD学习中的具体贡献,这挑战了现有对自蒸馏机制的理解。
| On-policy self-distillation (OPSD) | 在线策略自蒸馏,一种训练方法,学生模型基于自身输出并利用同一模型提供的监督进行学习。 |
| Privileged reference information | 特权参考信息,在训练过程中提供给模型的额外正确或参考信息,用于指导学习。 |
| Token-level supervision | 令牌级监督,在序列生成的每个令牌级别上提供的训练信号。 |
| Qwen3 | 一种大型语言模型系列,由阿里巴巴开发,用于自然语言处理任务。 |
| Distributional alignment | 分布一致性,衡量模型预测分布与某种参考分布之间的相似程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅