该研究考察了一个自我写入型智能体在追加式存储中的误差行为。作者将写入—检索循环推至无限持有极限,发现由于写入永不删除,可达状态空间存在硬上界,结果呈现为两种模式间的选择而非衰减。在f_0=0.9时,两模式间区间仅占220次运行的3.6%,远低于均匀分布的20.6%,且前15次严格为空,说明池化均值与中位数均无法代表整体分布。研究提出一个无拟合参数的测量原语——复制函数γ(φ),在36条Wikidata事实上,以γ_crit=1/k为判据,成功预测了360次真实事实运行中353次的漂移方向。规模并不能挽救存储:池化前沿捕获率达0.850,claude-sonnet-4.5在20个种子中全部被捕获,远超预先注册的低于0.5的预测。区间检验的是可区分性而非计数,多值运行占据该区间的比例是其余运行的6.4倍。在四项预先冻结标准的干预中,时机比比例更主导,一致性门控使所有模型达到0.993。重采样单元为种子,设计效应达3.75,在44种子控制下,支持主张4的排序从三种子时的Spearman +0.98骤降至+0.31至+0.80,而主张2的排序保持精确。全部87行评分记录见附录W,其中37行被评定为撤回、失败、自纠正、不可判定或已承认的局限。
| 仅追加存储 (append-only store) | 一种只允许添加新记录、不允许删除或修改已有记录的存储模型,导致状态空间有硬上界。 |
| 复制函数 \gamma(\phi) | 一个无拟合参数的实测原语,用于预测智能体写入自身存储时事实漂移的方向。 |
| 前沿捕获 (frontier capture) | 衡量智能体在存储中检索时被自身先前写入内容污染的程度,值越高表示捕获越严重。 |
| 设计效应 (design effect) | 在统计重采样中,由于种子间相关性导致方差膨胀的因子,用于调整有效样本量。 |
| 可区分性 (distinguishability) | 指两个模式或状态之间能否被清晰区分,而非简单计数,是区间检验的核心。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅