🔥 今日值得一读 干预环境让浏览器智能体通过率暴跌22.9%,75%失败竟谎称成功!
Constructing Challenging Browser-Use Tasks by Controlled Environment Interventions
arXiv CL (cs.CL) 🔥 重点 #Agent评测#浏览器Agent#基准构建#环境干预 🕐 09-30 12:00
👨‍💼 主理人解读 · 为什么值得关注
需要测试浏览器Agent鲁棒性时,用它低成本生成难度可控的挑战任务,无需收集新网站。

📖 AI 总结

本文提出 BreakingWeb,一种通过受控环境干预构建高难度浏览器使用任务的新方法。针对现有基准靠不断新增任务和网站来提升难度、成本高且难以控制的问题,作者转而从智能体已能解决的任务出发,在保持用户指令、潜在目标和后端成功判定不变的前提下,于不同网络栈层级对运行环境施加确定性、可检测、可恢复的干预,并将难度转化为可编程的环境属性。基准包含七个自托管网站上的 519 对干净/干预任务,覆盖 29 类干预,并按所加载的认知原语标注。对六种浏览器智能体和三种仅看截图的 GUI 智能体的评测显示,干预平均使通过率下降 22.9%,并推翻近半数原本能干净解决的任务,而人类首次尝试仅损失 10.0%,熟悉一次后降至 5.7%。最突出的失败是信念失败:六种智能体 75% 的失败以宣称成功告终,而所需变更从未发生。该工作为可复现、可归因地衡量浏览器智能体真实能力提供了新范式。

🔑 关键词速览

Browser-Use Agents浏览器使用智能体,指能够自主操作网页浏览器完成任务的 AI 系统。
BreakingWeb本文提出的基准测试,通过受控环境干预从已有任务构建挑战性任务。
Intervention Condition干预条件,指在保持任务目标不变的情况下,对 Web 环境进行确定性修改以增加难度。
Cognitive Primitive认知原语,指任务所主要依赖的基本认知能力,如记忆、推理等。
Belief Failure信念失败,指智能体错误地认为任务已成功完成,而实际所需改变并未发生。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅