该研究指出,仅以“裁决正确性”(verdict-only)评估视觉语言模型(VLM)在网页代理安全护栏中的表现,无法揭示模型是否真正依赖了支撑决策的视觉证据。作者构建了Mind2Web-Injection基准,包含9,954对指令-截图样本,提供像素级证据框与图像侧反事实。实验发现,六个VLM中,两个平均精度相近的模型在“证据对齐检测”(EAD)指标上相差九倍,该指标衡量攻击被检测且正确定位的比例。进一步测试显示,当替换指令为认可屏幕上命令的版本时,最强的开源定位模型Qwen3-VL-32B仅有58.7%的案例保持对齐,而GPT-5.6-luna达到99.9%。作者提出两种无需训练的干预方法:ReadGate改善定位而不改变裁决,CmdCompare测试显式指令-命令比较能否解决指令侧不一致。研究建议应分别报告裁决正确性、证据定位和反事实响应性,以更全面评估模型行为。
| Verdict-only evaluation | 仅基于最终判断结果(如是否冲突)的评估,不检查模型推理依据。 |
| Evidence-Aligned Detection (EAD) | 衡量攻击既被正确检测又正确定位的指标,反映模型利用视觉证据的能力。 |
| Mind2Web-Injection | 新基准数据集,包含指令-截图对及像素级证据框,用于评估视觉提示注入防护。 |
| Counterfactual | 反事实样本,通过修改指令或图像来测试模型决策是否依赖于特定证据。 |
| ReadGate | 一种无需训练的干预方法,旨在改善模型对视觉证据的接地而不改变最终裁决。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅