TWIST 是一套针对对话记忆系统"干预质量"的基准测试,旨在衡量记忆系统能否在用户信念发生变化的关键节点做出正确判断。该基准包含四条评测轨道,分别覆盖无提示的张力检测、对外发草稿的审核、基于当前信念作答并保留历史替代记录,以及敏感信息召回治理。其方法学特点是每项检测指标都配有匹配的"不过度检测"对照,用表面相似的困难负样本为误报定价,防止系统通过全部标记来刷分。基准本身先经人工验证,采用双盲标注与仲裁,在161条项目上达到0.85的kappa一致性。实验发现,现有系统难以同时兼顾矛盾召回率、负样本特异性和归因能力:扁平RAG基线能检出76%至97%的真实矛盾,却会误标16%至43%的安全草稿;而以连贯性为导向的部署系统几乎不误报,却仅能捕获42%的真实矛盾。这一权衡是仅看召回率的评分无法揭示的。
| TWIST | 一个用于评估对话记忆系统干预质量的基准套件,包含四个赛道。 |
| 干预质量 | 记忆系统在信念变化点是否通过其摄入/回忆/审查接口正确行动的能力。 |
| LoCoMo | 一个长对话记忆基准,TWIST 扩展了其语料库和测试框架。 |
| 困难负样本 | 表面匹配但实际安全的草稿,用于测试系统是否过度检测。 |
| 召回率 | 系统正确检测到真实矛盾的比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅