🔥 今日值得一读 LLM评判不可信?25个智能体实测:满意度与成功率脱节,57.5%对话未完成任务!
GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents
arXiv CL (cs.CL) 🔥 重点 #Agent#评测基准#LLM-as-Judge 🕐 09-14 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮开发者判断用户模拟评测排名是否可靠,避免误选Agent。

📖 AI 总结

这篇论文提出GAUGE协议,用于检验任务型LLM智能体评估中“用户模拟器对话+LLM裁判打分”这一低成本离线评估门控是否可靠。研究覆盖六个提供商的25个智能体,在τ²-bench和SimulatorArena两个基准上,将评估有效性拆分为排序有效性与构念有效性。关键发现有二:一是满意度与任务成功几乎不相关,被盲评小组判为“满意”的对话中57.5%实际未完成用户任务,该现象在五种评分人群、两个基准及所有主观维度上一致;二是该门控在能力差距较大的智能体间排序稳健,但在实力接近的强智能体间分辨率不足,决策分歧率从宽奖励配对的不足1%升至接近配对的31%。作者据此指出该门控虽经人类验证却锚定错误,并提出“先校准后信任”的评估节奏,以无需裁判的完成位作为截断回归的零成本预警。

🔑 关键词速览

LLM-as-a-Judge使用大型语言模型作为自动评判者来评估其他模型输出质量的方法。
GAUGE本文提出的可复用离线协议,用于衡量LLM评判门控的排名与可验证奖励的一致性。
排名效度评估方法能否正确区分不同智能体能力高低的效度。
构念效度评估方法是否真正测量了它意图测量的构念(如任务成功)的效度。
τ²-bench一个用于评估面向任务对话智能体的基准测试平台。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅