现有语言智能体的记忆框架大多依赖与真实环境的交互来积累经验,很少在构建记忆时追问"如果当时采取不同行动,反馈是否会改变"这一反事实问题,而在真实环境中直接获取此类反馈成本高昂且会破坏对比所需的状态。针对这一空白,作者提出 COUNTERMEM,一个用于跨任务构建和使用经验证的反事实记忆的强化学习框架。该方法在动作失败后,借助可执行世界模型(如测试、证明检查器、求解器)从原始状态的副本或重置中评估局部替代方案,并将改进结果连同原始动作、修正动作、验证后的结果及复用条件一并存储;同时学习一个记忆使用策略,决定检索记录还是跳过记忆,以平衡任务成功率与交互成本,且基础大模型保持固定,记忆与策略在留出评估中均被冻结。在六个领域共十二个基准设置上,使用 gpt-oss-120b 时,COUNTERMEM 使 ReAct 与 Reflexion 全部取得提升,平均增益达 12.6 个百分点,任务运行 token 减少 7.7% 至 42.0%。消融分析表明,去除验证或持久化存储会削弱增益,而将验证过的修正错误地应用于不适宜决策则可能产生反效果。该工作为智能体记忆提供了可验证的反事实构建路径,对提升任务表现与降低交互开销具有参考价值。
| COUNTERMEM | 本文提出的强化学习框架,用于构建和使用经过验证的反事实记忆,以提升语言智能体的任务表现。 |
| 反事实记忆(Counter-Factual Memory) | 记录“如果当时采取不同行动会得到什么反馈”的记忆,用于在未来任务中复用经过验证的修正方案。 |
| 世界模型(World Model) | 可执行的环境模拟器,如测试、证明检查器或求解器,用于在不改变真实状态的情况下评估替代行动的结果。 |
| 记忆使用策略(Memory-Use Policy) | 一个学习到的策略,决定是检索并应用记忆中的记录还是跳过记忆,以平衡任务成功与交互成本。 |
| ReAct / Reflexion | 两种语言智能体框架:ReAct 交替进行推理与行动,Reflexion 通过自我反思改进后续尝试;本文将其作为基线并增强。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅