🔥 今日值得一读 在线蒸馏失效?GraphOPD用图结构精准锁定智能体关键步骤,三大基准全面领先
GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents
arXiv LG (cs.LG) 🔥 重点 #知识蒸馏#LLM Agent#图增强#强化学习 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
解决多轮Agent蒸馏中早期偏差污染后续上下文的问题,用图结构分配更合理的步级监督。

📖 AI 总结

本文提出GraphOPD,一种面向大语言模型智能体的图增强在线策略蒸馏方法。在线策略蒸馏通过教师策略提供逐步密集指导,以缓解强化学习中奖励稀疏、每条轨迹仅反馈一次的问题。现有方法依据教师与学生策略在每一步的分歧大小来分配监督信号,但这一单轮直觉在多轮决策链中会失效:早期偏差会进入后续所有上下文,使教师与已漂移轨迹保持一致而无法定位错误根源,同时可替换步骤会产生大但无关结果的分歧。作者在智能体基准上验证,蒸馏最高分歧步骤相比随机选择并无稳定收益。GraphOPD首次将图结构增强引入在线策略蒸馏,利用环境自身记录的状态变化构建步骤依赖图,以随机游走平稳分布为各步骤评分,并与分歧信号融合为轨迹相对掩码,将监督集中于每条轨迹中最具潜力的步骤。在ALFWorld、WebShop和SearchQA上,跨三种模型规模和十一个基线,GraphOPD均表现有竞争力,最高较最强基线提升5.8个百分点。执行回放审计表明,该结构信用分对真实因果影响的追踪显著高于随机水平,两种融合信号各自必要,且该信号可迁移至域外工具集成推理任务。

🔑 关键词速览

在线策略蒸馏 (On-policy Distillation)一种后训练方法,学生策略在自身生成的轨迹上接受教师策略的步骤级指导,以缓解强化学习奖励稀疏的问题。
教师-学生散度 (Teacher-Student Divergence)衡量教师策略与学生策略在每一步输出分布上差异的指标,常用于决定蒸馏监督的分配。
依赖图 (Dependency Graph)从环境状态变化记录中构建的有向图,节点表示步骤,边表示步骤之间的因果依赖关系。
随机游走平稳分布 (Random-Walk Stationary Distribution)在依赖图上进行随机游走时,节点被访问的长期概率分布,用于为每个步骤分配结构信用分数。
轨迹相对掩码 (Trajectory-Relative Mask)一种将结构信用与散度信号融合后生成的掩码,用于在每条轨迹内选择性地聚焦监督到高适应性步骤。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅