🔥 今日值得一读 125个全失败任务中47个是假难题,真难题只有78个
What Makes a Terminal-Bench Task Hard? Separating Genuine Hardness from Fake-Hardness on an Adjudicated Agentic Corpus
arXiv LG (cs.LG) 🔥 重点 Agent评测基准论文方法 🕐 今天 12:00

📖 AI 总结

这篇论文研究前沿基准测试中"全失败任务"是否真正代表模型能力不足。作者基于Terminal-Bench 3 / Frontier-Bench 0.1的生产记录,涵盖1081个拉取请求、639个计分任务、28801次试验及约10.6万美元的智能体开销,对125个无诚实通过的任务进行多维度审查,包括任务工件、参考解运行、空解对照、对抗试验、轨迹与遥测数据等。结果显示,仅78个任务通过认证,可视为"已认证未解决"候选;其余包括14个验证器损坏、8个受基础设施故障主导、4个仅能通过绕过验证器通过,以及21个证据不足以证明可解性。研究强调,零通过率不等于真实难度,基准测试在将全失败任务作为能力声明前,应公开其背后的证据。

🔑 关键词速览

Terminal-Bench一个面向终端/命令行智能体任务的前沿基准测试套件,用于评估模型在真实终端环境中的任务解决能力。
Frontier-Bench一个前沿基准测试,旨在包含当前模型难以解决的任务,以衡量模型能力边界。
零通过率 / 全部失败任务指在评估中没有任何模型或智能体成功完成的任务,通常被误认为是困难任务。
验证器绕过指智能体通过非预期手段(如利用验证器漏洞)使任务被判定为通过,而非真正解决问题。
已认证未解决本文提出的标签,表示任务在作者路径通过、基础设施未主导、无严格绕过且所有评估智能体均失败的情况下仍未被解决。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅