本文提出 BreakingWeb,一种通过受控环境干预构建高难度浏览器使用任务的新方法。针对现有基准靠不断新增任务和网站来提升难度、成本高且难以控制的问题,作者转而从智能体已能解决的任务出发,在保持用户指令、潜在目标和后端成功判定不变的前提下,于不同网络栈层级对运行环境施加确定性、可检测、可恢复的干预,并将难度转化为可编程的环境属性。基准包含七个自托管网站上的 519 对干净/干预任务,覆盖 29 类干预,并按所加载的认知原语标注。对六种浏览器智能体和三种仅看截图的 GUI 智能体的评测显示,干预平均使通过率下降 22.9%,并推翻近半数原本能干净解决的任务,而人类首次尝试仅损失 10.0%,熟悉一次后降至 5.7%。最突出的失败是信念失败:六种智能体 75% 的失败以宣称成功告终,而所需变更从未发生。该工作为可复现、可归因地衡量浏览器智能体真实能力提供了新范式。
| Browser-Use Agents | 浏览器使用智能体,指能够自主操作网页浏览器完成任务的 AI 系统。 |
| BreakingWeb | 本文提出的基准测试,通过受控环境干预从已有任务构建挑战性任务。 |
| Intervention Condition | 干预条件,指在保持任务目标不变的情况下,对 Web 环境进行确定性修改以增加难度。 |
| Cognitive Primitive | 认知原语,指任务所主要依赖的基本认知能力,如记忆、推理等。 |
| Belief Failure | 信念失败,指智能体错误地认为任务已成功完成,而实际所需改变并未发生。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅