🔥 今日值得一读 视觉提示注入防护评测翻车:精度相同,证据对齐竟差9倍!
Beyond the Verdict: Evidence-Aligned Evaluation of Visual Prompt-Injection Guardrails
arXiv CV (cs.CV) 🔥 重点 #安全对齐#评测基准#多模态 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
这篇论文提供了新基准和评估指标,开发者可用它测试VLM防护系统是否真正基于视觉证据做决策,而非仅看准确率。

📖 AI 总结

该研究指出,仅以“裁决正确性”(verdict-only)评估视觉语言模型(VLM)在网页代理安全护栏中的表现,无法揭示模型是否真正依赖了支撑决策的视觉证据。作者构建了Mind2Web-Injection基准,包含9,954对指令-截图样本,提供像素级证据框与图像侧反事实。实验发现,六个VLM中,两个平均精度相近的模型在“证据对齐检测”(EAD)指标上相差九倍,该指标衡量攻击被检测且正确定位的比例。进一步测试显示,当替换指令为认可屏幕上命令的版本时,最强的开源定位模型Qwen3-VL-32B仅有58.7%的案例保持对齐,而GPT-5.6-luna达到99.9%。作者提出两种无需训练的干预方法:ReadGate改善定位而不改变裁决,CmdCompare测试显式指令-命令比较能否解决指令侧不一致。研究建议应分别报告裁决正确性、证据定位和反事实响应性,以更全面评估模型行为。

🔑 关键词速览

Verdict-only evaluation仅基于最终判断结果(如是否冲突)的评估,不检查模型推理依据。
Evidence-Aligned Detection (EAD)衡量攻击既被正确检测又正确定位的指标,反映模型利用视觉证据的能力。
Mind2Web-Injection新基准数据集,包含指令-截图对及像素级证据框,用于评估视觉提示注入防护。
Counterfactual反事实样本,通过修改指令或图像来测试模型决策是否依赖于特定证据。
ReadGate一种无需训练的干预方法,旨在改善模型对视觉证据的接地而不改变最终裁决。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅