这篇论文研究持久记忆智能体中的“记忆信任缺口”现象,即过时的存储事实会覆盖当前权威证据,且该问题随模型能力变化而不同。研究使用Qwen3系列(0.6/1.7/4/8B)模型,在“收益”和“安全”两套基准上测试。结果显示:在收益任务中,各规模模型均以92%-100%概率使用过时值;在安全任务中,较大模型在记忆被伪装成最新时更容易崩溃。通过2×2×2×2析因实验发现,触发过度信任的因素取决于模型规模——移除标签会加剧所有规模的过度信任,而“较新日期”特征对大规模模型影响更大。缓解措施同样依赖能力:展示元数据可提升大模型准确率,但小模型需预先解决冲突。该模式在Llama模型系列及外部数据集上得到验证。研究揭示记忆信任缺口本质是过度信任而非混淆,且与模型能力密切相关。
| Persistent Memory Agents | 具有持久记忆能力的智能代理,可存储和检索历史信息以辅助决策。 |
| Memory Trust Gap | 模型对存储记忆的过度信任程度,导致忽略当前权威证据的现象。 |
| Capability-Gated | 指危害或行为仅在模型达到一定能力水平时才出现或加剧。 |
| Benefit Suite | 测试套件,其中存储事实是解决问题所必需的,用于评估记忆的正面作用。 |
| Safety Suite | 测试套件,其中权威工具始终提供正确值,用于评估记忆导致的潜在危害。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅