仅8条提示词逼近1.4万条效果,刷新策略一换准确率暴涨4个百分点!
Prompt Breadth and Rollout Refresh Interact in On-Policy Distillation
arXiv CL (cs.CL) 重要 论文方法大模型蒸馏 🕐 今天 12:00

📖 AI 总结

该研究探讨在线策略蒸馏(OPD)中提示数量与响应生成策略刷新频率之间的交互作用。实验固定14,080条轨迹和110次优化器更新,在3×3数学推理设置下变化提示库规模与策略快照数量。结果显示:使用十个快照时,仅八个提示即可达到24.09%的平均准确率,接近使用14,080个不同提示的24.51%;但若响应冻结于初始策略,增加提示数量反而使准确率从21.16%降至19.05%,而在每次更新刷新策略的条件下,准确率则从23.61%升至25.57%,二者交互效应达4.07个百分点。此外,在两种教师模型下的匹配比较出现第二次反转:周期性刷新模型在短预算下准确率和答案完整度更高,但冻结响应模型在32K输出限制下以1.7至1.8倍的响应token量实现反超。研究表明,OPD中的提示效率同时取决于策略刷新方式和推理预算,提示数量并非越多越好。

🔑 关键词速览

On-Policy Distillation (OPD)在线策略蒸馏,一种训练学生模型的方法,使用学生模型自身生成的响应进行蒸馏学习。
Prompt Breadth提示词广度,指训练中使用的不同提示词的数量或多样性。
Rollout Refreshrollout 刷新,指在训练过程中定期更新生成响应的策略快照,以获取新的训练数据。
Policy Snapshot策略快照,指在训练过程中保存的模型策略的副本,用于生成响应。
Inference Budget推理预算,指在生成响应时允许使用的计算资源或 token 数量限制。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅