该研究探讨在线策略蒸馏(OPD)中提示数量与响应生成策略刷新频率之间的交互作用。实验固定14,080条轨迹和110次优化器更新,在3×3数学推理设置下变化提示库规模与策略快照数量。结果显示:使用十个快照时,仅八个提示即可达到24.09%的平均准确率,接近使用14,080个不同提示的24.51%;但若响应冻结于初始策略,增加提示数量反而使准确率从21.16%降至19.05%,而在每次更新刷新策略的条件下,准确率则从23.61%升至25.57%,二者交互效应达4.07个百分点。此外,在两种教师模型下的匹配比较出现第二次反转:周期性刷新模型在短预算下准确率和答案完整度更高,但冻结响应模型在32K输出限制下以1.7至1.8倍的响应token量实现反超。研究表明,OPD中的提示效率同时取决于策略刷新方式和推理预算,提示数量并非越多越好。
| On-Policy Distillation (OPD) | 在线策略蒸馏,一种训练学生模型的方法,使用学生模型自身生成的响应进行蒸馏学习。 |
| Prompt Breadth | 提示词广度,指训练中使用的不同提示词的数量或多样性。 |
| Rollout Refresh | rollout 刷新,指在训练过程中定期更新生成响应的策略快照,以获取新的训练数据。 |
| Policy Snapshot | 策略快照,指在训练过程中保存的模型策略的副本,用于生成响应。 |
| Inference Budget | 推理预算,指在生成响应时允许使用的计算资源或 token 数量限制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅