本文针对企业级长周期智能体的持久记忆管理问题提出"环境探测式策展"方法。传统后任务策展智能体仅依赖已完成轨迹,容易固化错误、过度泛化局部证据或保留过时知识。该方法为现有异步策展智能体赋予最小权限的只读环境工具,用于核查、界定和刷新候选记忆,无需重新训练模型,也不改变任务智能体、检索器、记忆表示及生产写入权限。在基于GitHub Copilot SDK构建的生产级测试环境中,作者对比了无状态执行、全上下文学习、GHCP+Mem及加入环境探测的GHCP+Mem四种方案,覆盖CLBench数据库探索任务与90项改编自APEX的管理咨询任务。结果显示,在CLBench上探测机制将通过率从39%提升至73%,通过折扣奖励从8.60升至22.60,同时将每题查询数从8.8降至4.7,任务智能体成本从3.38美元降至1.68美元;在六个APEX场景中,全部18项记忆与基线对比的平均奖励均为正向,任务智能体工具调用减少16%至75%,且探测在五个场景中实现了最佳的单位成本奖励增益。该研究的意义在于将现有智能体记忆策展转变为环境知情、可审计的过程,同时保持任务时接口的紧凑性。
| 环境探测策展 | 一种为异步策展智能体提供只读世界工具,以检查、界定和刷新候选记忆的方法。 |
| GHCP | GitHub Copilot的缩写,本文中作为类生产智能体测试框架的基础。 |
| CLBench | 用于评估数据库探索任务的基准测试集。 |
| APEX | 管理咨询任务套件,本文中使用了90个改编任务进行评估。 |
| 模式漂移 | 指记忆表示或数据结构随时间发生非预期变化的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅