🔥 今日值得一读 多轮智能体蒸馏总翻车?随机教师干预用KL散度动态救场,性能全面领先!
Stochastic Teacher Intervention for Agentic On-Policy Distillation
arXiv CL (cs.CL) 🔥 重点 #在线蒸馏#Agent#多轮对话#训练方法 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
解决多轮Agent蒸馏中错误累积问题,让强模型能力更可靠地迁移到学生模型,适合Agent训练。

📖 AI 总结

本文提出STI-OPD,一种面向多轮智能体在线策略蒸馏的随机教师干预框架。在线策略蒸馏通过学生自生成轨迹上的密集词元监督来迁移教师能力,但在多轮智能体任务中,学生的早期决策会改变后续观测,导致错误逐轮累积,轨迹逐渐偏离教师分布,使教师的词元级监督变得不可靠甚至有害。STI-OPD依据师生策略差异引导教师干预,用教师生成的动作替换学生提议的动作,并以KL散度估计策略差异、将其映射为干预概率,通过采样自适应地平衡教师控制与学生探索,克服了以往阈值式或固定调度方法的局限。为从混合策略轨迹中学习,作者引入重要性加权反向KL目标,校正教师生成回复与学生策略之间的词元采样失配,从而保持原始蒸馏目标。在工具集成推理与长程交互任务上,该方法在所有评测基准和学生规模上均优于最强基线,消融实验表明差异引导干预与重要性加权均有贡献。

🔑 关键词速览

On-policy Distillation (OPD)在线策略蒸馏,一种让学生模型在自身生成的轨迹上接受教师模型 token 级监督的知识迁移方法。
Agentic Task智能体任务,指模型需要多轮交互、根据环境反馈做出决策的复杂任务,如工具调用和长时程规划。
Teacher Intervention教师干预,在训练过程中用教师模型生成的动作替换学生模型提出的动作,以提供更可靠的监督信号。
KL DivergenceKL 散度,一种衡量两个概率分布差异的指标,此处用于估计教师与学生策略之间的差异程度。
Importance-Weighted Reverse KL重要性加权反向 KL,一种校正混合策略轨迹中 token 采样不匹配的目标函数,用于保持原始蒸馏目标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅