这篇论文提出,现有大语言模型智能体的记忆系统主要针对回忆型任务,但缺乏对世界状态演变的追踪能力。作者将这一能力定义为“状态追踪”,并构建了包含234个多会话场景的基准测试StateMemBench,通过封闭式评分区分回答反映的是当前状态还是已被取代的旧状态。研究发现,现有记忆系统、检索增强基线和长上下文基线在该任务上均表现不佳。为此,作者提出状态优先的记忆方法StateMem,显式追踪状态取代关系和依赖依赖,在DeepSeek-V4-Flash上将当前状态准确率提升至0.363(为最强同骨干基线的1.8倍),在Qwen-3.5-9B上提升至0.233(为最强记忆系统的1.6倍)。此外,该方法可作为轻量级单次调用包装器,在六个记忆与检索后端上将准确率提升32至67个百分点,其中15至32个百分点归因于状态结构本身而非额外上下文。
| StateMemBench | 一个用于评估智能体记忆系统状态跟踪能力的基准,包含234个多会话场景。 |
| StateMem | 一种状态优先的记忆方法,显式跟踪状态取代和依赖关系,提升当前状态准确率。 |
| state tracking | 记忆系统跟踪世界状态演变的能力,确保答案反映最新状态而非过时信息。 |
| closed-pool grading | 一种评分机制,根据答案是否反映当前状态、被取代状态或两者皆非来打分。 |
| retrieval-augmented baselines | 基于检索增强的基线方法,通过外部检索来辅助模型生成答案。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅