这篇论文挑战了多智能体辩论(MAD)提升推理能力的既有认知。研究以23个小型开源模型为对象,覆盖11个厂商家族、5项任务和5500余次辩论与对照实验,从人格设定、采样温度和模型身份三个维度检验"认知多样性驱动增益"这一假说,结果在每一维度上均被否定。实验发现,辩论虽比单智能体推理高出3至7分,但在生成预算匹配的条件下,其表现与自一致性采样持平甚至更差,且耗时达1.6倍、token成本达3.4倍。人格提示反而降低准确率,作者称之为"人格税"而非多样性税;混合模型团队也不敌其成员各自的多数投票,准确率取决于成员能力而非异质性。研究还揭示辩论记录静默溢出服务上下文窗口这一测量隐患,仅修正该问题即使辩论与采样的对比从负1.8分变为持平。作者据此认为,此前报告的MAD增益实为集成采样效应,并为未来辩论机制设定了预算匹配、污染受控的基线门槛。
| 多智能体辩论 (Multi-Agent Debate, MAD) | 一种让多个语言模型智能体通过多轮交换答案和推理来提升推理与事实性的方法。 |
| 认知多样性 (Cognitive Diversity) | 智能体之间在角色、采样温度或模型身份等方面的差异,本文检验其是否为辩论增益的驱动因素。 |
| 自一致性采样 (Self-Consistency Sampling) | 对同一模型进行多次采样并取多数投票的集成方法,作为辩论的预算匹配对照。 |
| 角色税 (Persona Tax) | 角色提示带来的准确性损失,本文发现冗余角色伤害最大,而非多样性本身导致损失。 |
| 上下文窗口溢出 (Context Window Overflow) | 辩论记录超出模型服务上下文窗口的测量风险,会导致结果偏差,纠正后辩论与采样比较从-1.8分变为持平。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅