本文关注并行多智能体推理系统中的不确定性估计问题。这类系统由多个智能体在多轮中求解同一问题并聚合输出,其可靠性不仅取决于单次生成,还取决于智能体之间的交互与跨轮演化,而现有研究对此关注不足。作者提出SAUCE方法,一种轻量、无需训练的不确定性估计器,将多智能体系统的不确定性建模为对潜在系统级信念的序贯推断,通过滤波式更新聚合轮级一致性与生成不确定性信号。在五种骨干模型、五个基准和两种多智能体协议上,SAUCE在误分类检测、选择性预测和校准方面均优于基于对数似然的标准方法及多智能体专用估计器。该工作为多智能体推理系统的可靠性评估提供了新思路。
| Parallel Multi-Agent Reasoning Systems | 并行多智能体推理系统:多个智能体在多轮中并行解决同一问题并聚合输出。 |
| Uncertainty Estimation | 不确定性估计:量化模型预测可靠性的方法,用于检测错误和校准置信度。 |
| SAUCE | Sequential Agent Uncertainty through Consensus Evolution:一种轻量级、无需训练的不确定性估计器,将 MAS 不确定性建模为序列推断。 |
| Latent System-level Belief | 潜在系统级信念:表示整个多智能体系统在推理过程中对问题答案的隐含信念状态。 |
| Filtering-style Update | 滤波式更新:一种递归贝叶斯更新方法,用于融合新观测以更新潜在状态估计。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅