该研究系统评估了仅基于最终结果的LLM智能体评估方法的盲区。作者在确定性工具使用环境中,通过脚本化策略和故障注入构建了400条轨迹,比较了五种评估器在检测、定位、分类、校准和成本上的表现。核心发现是:仅看结果的评估器能捕获84%的“显性故障”,但对“隐性故障”(结果未受影响但过程出错)的召回率仅45%,且会误报33%的正确轨迹。相比之下,分步评估器在零误报情况下达到77%的隐性故障召回率,但成本增加3倍。研究还发现所有评估器都忽视最终回复内容——虚构承诺能完全绕过规则评估器,并骗过分步评估器82%的情况。作者主张评估研究必须按结果存活性分层报告召回率,并公开了完整环境、注入器和分析管线。
| Outcome-only evaluation | 仅基于最终结果(如请求和回复)进行评估,忽略中间过程的方法。 |
| Agent trajectories | 智能体在执行任务过程中所采取的一系列动作和中间状态。 |
| Fault injector | 一种工具,用于在系统中故意引入错误,以测试系统的鲁棒性和检测能力。 |
| Step-rubric judge | 一种评估方法,根据预定义的逐步评分标准对智能体的每一步进行评分。 |
| Self-consistency ensemble | 一种集成方法,通过多次采样生成多个答案,并选择最一致的答案来提高可靠性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅