本文提出了一种名为“激活条件自蒸馏”(ACSD)的新方法,旨在改进大模型推理中的在线自蒸馏效果。传统方法依赖参考答案作为特权信息,但难以保证长回复中每个token的监督质量。ACSD的核心思路是:对比同一模型生成的、在预算内到达正确答案的轨迹与其余轨迹的激活差异,提取出一个“引导向量”,并由基础模型的冻结副本在每个预测位置施加该向量,学生模型则从自身生成前缀的下一token分布中学习。该方法无需问题专属参考文本,也无需更新教师参数,推理时仅使用蒸馏后的学生模型。在五个模型、四个数学基准上,ACSD均取得最高平均准确率;在DeepSeek-R1-0528-Qwen3-8B上,数学平均准确率达71.9%,LiveCodeBench v6 pass@12达70.9%,均优于参考条件基线。研究还发现,正确轨迹之间的对比同样支持蒸馏,提取的方向可跨数学数据集复用,且ACSD在固定学生轨迹上的后期logit更新幅度比基线更稳定。
| Activation-Conditioned Self-Distillation (ACSD) | 一种自蒸馏方法,通过对比正确与错误轨迹的激活来提取引导向量,用于指导学生模型训练。 |
| On-policy self-distillation (OPSD) | 在线自蒸馏,模型作为自己的教师,通常通过参考解答条件提供密集监督。 |
| Steering vector | 引导向量,从激活对比中提取的方向向量,用于在预测时调整模型行为。 |
| Outcome verification | 结果验证,用于判断生成轨迹是否达到正确答案,以构建引导方向和校准。 |
| Logit-update magnitudes | logit 更新幅度,衡量模型输出分布变化程度的指标,用于评估蒸馏稳定性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅