🔥 今日值得一读 智能体绕路也能变绝招!Trace框架让AUC飙升30%,Final-3猛涨40.5%!
Success Leaves Detours: Learning Executable Walkthroughs for Long-Horizon Agents
arXiv LG (cs.LG) 🔥 重点 Agent论文方法 🕐 今天 12:00

📖 AI 总结

本文研究长时程智能体在稀疏奖励下如何从含失败、循环和绕路的轨迹中提炼可执行经验。作者指出,延迟信用只能识别与进展相关的动作,却无法判断其是否产生后续动作所需的事实。为此提出Trace框架,通过奖励与持久状态变化检测进展锚点、传播信用识别关键转移,并利用跨回合成败证据估计动作前置条件,再经反向依赖切片提取依赖一致的动作链,去除无关循环与绕路,生成包含入口条件、有序状态—动作—效果步骤及完成与失败谓词的可执行Walkthrough记忆。在J-TTL、WebShop和ScienceWorld上,Trace一致优于八种测试时学习与记忆基线,相比最强基线平均AUC和Final-3分别提升30.0%和40.5%,且推理token更少。结果表明,长时程交互更受益于状态条件下的可执行流程,而非完整轨迹或抽象摘要。

🔑 关键词速览

可执行演练(Executable Walkthrough)从轨迹中提取的紧凑、状态条件化且可验证的过程,包含进入条件、有序步骤及完成/失败谓词,可直接执行和复用。
稀疏奖励轨迹(Sparse-Reward Trajectory)智能体与环境交互产生的序列,其中奖励信号稀少,大部分步骤没有即时反馈,常包含失败、循环和绕路。
延迟信用分配(Delayed Credit Assignment)在稀疏奖励下,将最终的成功或失败归因到之前多个时间步的动作上,以识别哪些动作对进展有贡献。
反向依赖切片(Backward Dependency Slicing)从目标状态出发,反向追溯每个所需事实的产生动作,从而提取出依赖一致的动作链,并剔除无关步骤。
测试时自进化智能体(Test-Time Self-Evolving Agent)在测试阶段通过复用过去经验(如记忆或总结)来持续改进自身策略的智能体,无需额外训练。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅