无需训练就能测准多智能体推理的不确定性,SAUCE在5个模型5个基准上全面超越基线!
Sequential Probabilistic Uncertainty Estimation for Parallel Multi-Agent Reasoning Systems
arXiv AI (cs.AI) 重要 Agent论文方法 🕐 今天 12:00

📖 AI 总结

本文关注并行多智能体推理系统中的不确定性估计问题。这类系统由多个智能体在多轮中求解同一问题并聚合输出,其可靠性不仅取决于单次生成,还取决于智能体之间的交互与跨轮演化,而现有研究对此关注不足。作者提出SAUCE方法,一种轻量、无需训练的不确定性估计器,将多智能体系统的不确定性建模为对潜在系统级信念的序贯推断,通过滤波式更新聚合轮级一致性与生成不确定性信号。在五种骨干模型、五个基准和两种多智能体协议上,SAUCE在误分类检测、选择性预测和校准方面均优于基于对数似然的标准方法及多智能体专用估计器。该工作为多智能体推理系统的可靠性评估提供了新思路。

🔑 关键词速览

Parallel Multi-Agent Reasoning Systems并行多智能体推理系统:多个智能体在多轮中并行解决同一问题并聚合输出。
Uncertainty Estimation不确定性估计:量化模型预测可靠性的方法,用于检测错误和校准置信度。
SAUCESequential Agent Uncertainty through Consensus Evolution:一种轻量级、无需训练的不确定性估计器,将 MAS 不确定性建模为序列推断。
Latent System-level Belief潜在系统级信念:表示整个多智能体系统在推理过程中对问题答案的隐含信念状态。
Filtering-style Update滤波式更新:一种递归贝叶斯更新方法,用于融合新观测以更新潜在状态估计。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅