这篇论文提出GAUGE协议,用于检验任务型LLM智能体评估中“用户模拟器对话+LLM裁判打分”这一低成本离线评估门控是否可靠。研究覆盖六个提供商的25个智能体,在τ²-bench和SimulatorArena两个基准上,将评估有效性拆分为排序有效性与构念有效性。关键发现有二:一是满意度与任务成功几乎不相关,被盲评小组判为“满意”的对话中57.5%实际未完成用户任务,该现象在五种评分人群、两个基准及所有主观维度上一致;二是该门控在能力差距较大的智能体间排序稳健,但在实力接近的强智能体间分辨率不足,决策分歧率从宽奖励配对的不足1%升至接近配对的31%。作者据此指出该门控虽经人类验证却锚定错误,并提出“先校准后信任”的评估节奏,以无需裁判的完成位作为截断回归的零成本预警。
| LLM-as-a-Judge | 使用大型语言模型作为自动评判者来评估其他模型输出质量的方法。 |
| GAUGE | 本文提出的可复用离线协议,用于衡量LLM评判门控的排名与可验证奖励的一致性。 |
| 排名效度 | 评估方法能否正确区分不同智能体能力高低的效度。 |
| 构念效度 | 评估方法是否真正测量了它意图测量的构念(如任务成功)的效度。 |
| τ²-bench | 一个用于评估面向任务对话智能体的基准测试平台。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅