智能体自写存储闭环实测:353/360次漂移方向被无参数原语预测,规模无法挽救存储!
Self-Cleaning and Captured Anyway: One Measured Primitive for Error in a Store an Agent Writes to Itself, and What a Falling Score Actually Measures
arXiv CL (cs.CL) Agent论文方法记忆 🕐 今天 12:00

📖 AI 总结

该研究考察了一个自我写入型智能体在追加式存储中的误差行为。作者将写入—检索循环推至无限持有极限,发现由于写入永不删除,可达状态空间存在硬上界,结果呈现为两种模式间的选择而非衰减。在f_0=0.9时,两模式间区间仅占220次运行的3.6%,远低于均匀分布的20.6%,且前15次严格为空,说明池化均值与中位数均无法代表整体分布。研究提出一个无拟合参数的测量原语——复制函数γ(φ),在36条Wikidata事实上,以γ_crit=1/k为判据,成功预测了360次真实事实运行中353次的漂移方向。规模并不能挽救存储:池化前沿捕获率达0.850,claude-sonnet-4.5在20个种子中全部被捕获,远超预先注册的低于0.5的预测。区间检验的是可区分性而非计数,多值运行占据该区间的比例是其余运行的6.4倍。在四项预先冻结标准的干预中,时机比比例更主导,一致性门控使所有模型达到0.993。重采样单元为种子,设计效应达3.75,在44种子控制下,支持主张4的排序从三种子时的Spearman +0.98骤降至+0.31至+0.80,而主张2的排序保持精确。全部87行评分记录见附录W,其中37行被评定为撤回、失败、自纠正、不可判定或已承认的局限。

🔑 关键词速览

仅追加存储 (append-only store)一种只允许添加新记录、不允许删除或修改已有记录的存储模型,导致状态空间有硬上界。
复制函数 \gamma(\phi)一个无拟合参数的实测原语,用于预测智能体写入自身存储时事实漂移的方向。
前沿捕获 (frontier capture)衡量智能体在存储中检索时被自身先前写入内容污染的程度,值越高表示捕获越严重。
设计效应 (design effect)在统计重采样中,由于种子间相关性导致方差膨胀的因子,用于调整有效样本量。
可区分性 (distinguishability)指两个模式或状态之间能否被清晰区分,而非简单计数,是区间检验的核心。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅