这篇论文提出了“认知Sybil问题”这一概念,指出多智能体AI系统中,增加智能体数量并不等同于增加独立证据。作者将报告Z定义为相对于既有报告R的认知Sybil扩展,当且仅当条件互信息I(Θ; Z | R) = 0,即新报告不提供任何额外信息。研究通过高斯共享根模型证明,共同祖先并不必然导致完全冗余,重复提取可逼近源级信息上限,但共享基础模型引发的相关提取误差会降低该上限。基于超过2万次LLM智能体实验,固定单一证据根并将报告数从1增至32,朴素后验覆盖率从0.940骤降至0.263;而固定报告数、将独立证据根从1增至16则能弥合差距。研究还发现,表征相似性对去重机制的影响远大于真实祖先关系。结论强调,集体推理应追踪证据来源与依赖结构,而非智能体或报告的数量及表面相似性。
| Epistemic Sybil problem | 认识论女巫问题:指在信息聚合中,多个报告可能源自同一证据,导致看似独立实则冗余,从而误导推理的问题。 |
| Sybil extension | 女巫扩展:在给定已有报告 R 的条件下,新报告 Z 不提供额外信息(即互信息为零)的情况。 |
| Gaussian shared-root model | 高斯共享根模型:一种统计模型,假设多个观测共享一个共同根因,用于分析共同祖先对信息冗余的影响。 |
| LLM-agent | 大语言模型智能体:基于大型语言模型构建的自主代理,用于执行报告生成或信息提取等任务。 |
| Correlated extraction errors | 相关提取误差:不同智能体在提取信息时产生的系统性相关错误,可能由共享的基础模型引起,降低信息聚合的有效性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅