一项由评估公司Vals AI开展的研究显示,多智能体团队相比单个智能体几乎无法带来可衡量的质量提升,却消耗了远超比例的计算资源。研究在Vibe Code Bench上测试了GPT-6 Sol与Claude Opus 5.5,团队模式的成本是单智能体的1.8至5.1倍,但四项对比中仅一项出现统计显著的改进。Anthropic的测试也表明,将智能体数量从10个扩展到100个,性能提升十分有限。OpenAI研究员Noam Brown指出,多智能体系统主要换来的是速度而非质量,且效果高度依赖任务类型,网页研究和数学等可并行任务受益明显,而写小说等任务则不然。开发者Eric Provencher将智能体间协调失败带来的损耗称为“协调税”。研究结论是,在模型已满负荷运行时,组建智能体团队在多数情况下并不划算。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅