🔥 今日值得一读 结果评判漏掉55%静默故障!逐步评分召回率77%零误报,成本仅3倍
trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories
arXiv CL (cs.CL) 🔥 重点 Agent论文方法 🕐 09-02 12:00

📖 AI 总结

该研究系统评估了仅基于最终结果的LLM智能体评估方法的盲区。作者在确定性工具使用环境中,通过脚本化策略和故障注入构建了400条轨迹,比较了五种评估器在检测、定位、分类、校准和成本上的表现。核心发现是:仅看结果的评估器能捕获84%的“显性故障”,但对“隐性故障”(结果未受影响但过程出错)的召回率仅45%,且会误报33%的正确轨迹。相比之下,分步评估器在零误报情况下达到77%的隐性故障召回率,但成本增加3倍。研究还发现所有评估器都忽视最终回复内容——虚构承诺能完全绕过规则评估器,并骗过分步评估器82%的情况。作者主张评估研究必须按结果存活性分层报告召回率,并公开了完整环境、注入器和分析管线。

🔑 关键词速览

Outcome-only evaluation仅基于最终结果(如请求和回复)进行评估,忽略中间过程的方法。
Agent trajectories智能体在执行任务过程中所采取的一系列动作和中间状态。
Fault injector一种工具,用于在系统中故意引入错误,以测试系统的鲁棒性和检测能力。
Step-rubric judge一种评估方法,根据预定义的逐步评分标准对智能体的每一步进行评分。
Self-consistency ensemble一种集成方法,通过多次采样生成多个答案,并选择最一致的答案来提高可靠性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅