记忆越强越危险!AI模型越大越信旧笔记,权威数据被覆盖概率高达100%!
The Memory Trust Gap: Capability-Dependent Failures in Persistent-Memory Agents
arXiv AI (cs.AI) 重要 #Agent#记忆机制#评测基准 🕐 09-03 12:00

📖 AI 总结

这篇论文研究持久记忆智能体中的“记忆信任缺口”现象,即过时的存储事实会覆盖当前权威证据,且该问题随模型能力变化而不同。研究使用Qwen3系列(0.6/1.7/4/8B)模型,在“收益”和“安全”两套基准上测试。结果显示:在收益任务中,各规模模型均以92%-100%概率使用过时值;在安全任务中,较大模型在记忆被伪装成最新时更容易崩溃。通过2×2×2×2析因实验发现,触发过度信任的因素取决于模型规模——移除标签会加剧所有规模的过度信任,而“较新日期”特征对大规模模型影响更大。缓解措施同样依赖能力:展示元数据可提升大模型准确率,但小模型需预先解决冲突。该模式在Llama模型系列及外部数据集上得到验证。研究揭示记忆信任缺口本质是过度信任而非混淆,且与模型能力密切相关。

🔑 关键词速览

Persistent Memory Agents具有持久记忆能力的智能代理,可存储和检索历史信息以辅助决策。
Memory Trust Gap模型对存储记忆的过度信任程度,导致忽略当前权威证据的现象。
Capability-Gated指危害或行为仅在模型达到一定能力水平时才出现或加剧。
Benefit Suite测试套件,其中存储事实是解决问题所必需的,用于评估记忆的正面作用。
Safety Suite测试套件,其中权威工具始终提供正确值,用于评估记忆导致的潜在危害。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅