本文提出GraphOPD,一种面向大语言模型智能体的图增强在线策略蒸馏方法。在线策略蒸馏通过教师策略提供逐步密集指导,以缓解强化学习中奖励稀疏、每条轨迹仅反馈一次的问题。现有方法依据教师与学生策略在每一步的分歧大小来分配监督信号,但这一单轮直觉在多轮决策链中会失效:早期偏差会进入后续所有上下文,使教师与已漂移轨迹保持一致而无法定位错误根源,同时可替换步骤会产生大但无关结果的分歧。作者在智能体基准上验证,蒸馏最高分歧步骤相比随机选择并无稳定收益。GraphOPD首次将图结构增强引入在线策略蒸馏,利用环境自身记录的状态变化构建步骤依赖图,以随机游走平稳分布为各步骤评分,并与分歧信号融合为轨迹相对掩码,将监督集中于每条轨迹中最具潜力的步骤。在ALFWorld、WebShop和SearchQA上,跨三种模型规模和十一个基线,GraphOPD均表现有竞争力,最高较最强基线提升5.8个百分点。执行回放审计表明,该结构信用分对真实因果影响的追踪显著高于随机水平,两种融合信号各自必要,且该信号可迁移至域外工具集成推理任务。
| 在线策略蒸馏 (On-policy Distillation) | 一种后训练方法,学生策略在自身生成的轨迹上接受教师策略的步骤级指导,以缓解强化学习奖励稀疏的问题。 |
| 教师-学生散度 (Teacher-Student Divergence) | 衡量教师策略与学生策略在每一步输出分布上差异的指标,常用于决定蒸馏监督的分配。 |
| 依赖图 (Dependency Graph) | 从环境状态变化记录中构建的有向图,节点表示步骤,边表示步骤之间的因果依赖关系。 |
| 随机游走平稳分布 (Random-Walk Stationary Distribution) | 在依赖图上进行随机游走时,节点被访问的长期概率分布,用于为每个步骤分配结构信用分数。 |
| 轨迹相对掩码 (Trajectory-Relative Mask) | 一种将结构信用与散度信号融合后生成的掩码,用于在每条轨迹内选择性地聚焦监督到高适应性步骤。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅