这篇论文提出了一个名为MERIT的基准测试框架,用于在考虑成本的前提下评估长期记忆对使用工具的LLM智能体的实际效用。作者指出,现有记忆评估基准主要衡量对话历史问答能力,而非记忆是否真正改变智能体的任务执行行为。MERIT包含三个领域的工具使用任务,并通过泄漏检查验证任务对先前事实的依赖。在23,440个评分片段中,记忆将依赖任务的成功率从0提升至0.55-1.00。研究发现,嵌入检索在更新事实场景下表现不稳定,而结构化存储和LLM摘要等写入时更新方法更可靠。此外,记忆实现方式的改变可使任务成功率波动高达60个百分点,且完整重放策略在经济上始终不划算。该研究强调了记忆评估中成本意识的重要性,并为工具型智能体的记忆设计提供了实证参考。
| MERIT | 用于现实仪器化任务的记忆评估,一个衡量工具使用LLM代理长期记忆边际效用的基准和测试框架。 |
| marginal utility | 边际效用,指增加一个单位的记忆资源对任务成功率的额外贡献,在成本核算下评估。 |
| leak check | 泄漏检查,一种自动化验证方法,确保任务结果不依赖于测试数据中的信息泄漏。 |
| embedding retrieval | 嵌入检索,一种通过向量相似性从记忆中检索相关事实的方法,但在更新事实时表现不稳定。 |
| update-on-write stores | 写入时更新存储,一种记忆实现,在事实更新时主动修改存储内容,如结构化事实存储或LLM摘要。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅