共享学习率根本不中性!选择性蒸馏结论随学习率翻倍,最高差17.7个百分点
A Shared Learning Rate Is Not a Neutral Control in Selective On-Policy Distillation
arXiv LG (cs.LG) 重要 蒸馏论文方法 🕐 今天 12:00

📖 AI 总结

本文研究选择性在线策略蒸馏中一个被普遍忽视的方法论问题:文献通常用单一共享学习率来比较不同选择器,并默认这一控制变量是中性的。作者在GSM8K上以Qwen2.5-1.5B为学生、7B为教师,采用LoRA进行8倍学习率网格实验,发现密集监督对学习率基本不敏感(波动1.8个百分点,p=0.26),而所有选择性训练分支都随学习率显著变化:随机5%子集波动5.4个百分点,全变差选择器6.7个百分点,可教性选择器高达17.7个百分点。这导致密集与选择性的对比结论在学习率1e-4时为10.1个百分点,在5e-5时仅为5.1个百分点,相差2倍;六个选择器两两显著性判断中有两个在相邻学习率间发生翻转。作者将这一现象命名为“选择器—学习率纠缠”,并证明其根源在于选择机制本身而非步长,因为尽管各分支梯度范数相差15.5倍,AdamW更新幅度与学习率的偏差仍在2.2%以内。预注册的冻结评分消融实验显示,实时评分额外带来3.79±1.69个百分点的学习率敏感性,而冻结评分分支仍显著纠缠,说明反馈回路只是加剧而非导致该现象。在文献实际使用的全量微调学习率区间内,该模式进一步放大。作者因此建议,选择器比较必须报告“分支×学习率”矩阵,而非单一共享学习率下的结果。

🔑 关键词速览

选择性同策略蒸馏一种训练方法,学生模型仅在由选择器评分最高的 token 位置接受监督,而非在所有位置。
选择器-学习率纠缠指选择性蒸馏中,选择器的效果与学习率相互依赖,导致在共享学习率下比较选择器会产生误导性结论。
LoRA低秩适应,一种参数高效微调方法,通过低秩矩阵更新预训练模型权重。
全变差选择器一种选择器,基于学生与教师分布之间的全变差距离来评分 token 位置。
冻结评分消融一种实验设计,其中选择器的评分在训练前由初始学生模型固定,以隔离实时评分反馈的影响。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅