本文提出STI-OPD,一种面向多轮智能体在线策略蒸馏的随机教师干预框架。在线策略蒸馏通过学生自生成轨迹上的密集词元监督来迁移教师能力,但在多轮智能体任务中,学生的早期决策会改变后续观测,导致错误逐轮累积,轨迹逐渐偏离教师分布,使教师的词元级监督变得不可靠甚至有害。STI-OPD依据师生策略差异引导教师干预,用教师生成的动作替换学生提议的动作,并以KL散度估计策略差异、将其映射为干预概率,通过采样自适应地平衡教师控制与学生探索,克服了以往阈值式或固定调度方法的局限。为从混合策略轨迹中学习,作者引入重要性加权反向KL目标,校正教师生成回复与学生策略之间的词元采样失配,从而保持原始蒸馏目标。在工具集成推理与长程交互任务上,该方法在所有评测基准和学生规模上均优于最强基线,消融实验表明差异引导干预与重要性加权均有贡献。
| On-policy Distillation (OPD) | 在线策略蒸馏,一种让学生模型在自身生成的轨迹上接受教师模型 token 级监督的知识迁移方法。 |
| Agentic Task | 智能体任务,指模型需要多轮交互、根据环境反馈做出决策的复杂任务,如工具调用和长时程规划。 |
| Teacher Intervention | 教师干预,在训练过程中用教师模型生成的动作替换学生模型提出的动作,以提供更可靠的监督信号。 |
| KL Divergence | KL 散度,一种衡量两个概率分布差异的指标,此处用于估计教师与学生策略之间的差异程度。 |
| Importance-Weighted Reverse KL | 重要性加权反向 KL,一种校正混合策略轨迹中 token 采样不匹配的目标函数,用于保持原始蒸馏目标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅