🔥 今日值得一读 三个视觉语言模型68-91%的错误里中层竟编码了正确答案,却对最终预测零因果影响!
Encoded but Disconnected: Decomposing Vision-Language Model Failures under a Patching Null
arXiv CV (cs.CV) 🔥 重点 #视觉语言模型#可解释性#因果分析 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
提醒开发者VLM中层信息未必影响输出,做可解释性干预时需谨慎解读。

📖 AI 总结

该研究在LLaVA-1.5-7B、Qwen2.5-VL-7B和InternVL3-8B三种视觉语言模型架构上,报告了一项关于中层可解释性的普遍性负面发现。在三个模型共同采用的POPE基准上,中层在68%至91%的错误样本中编码了正确答案,但这一信号对最终预测并不具有因果作用:残差流补丁在层级上对三种架构均产生0%的非平凡翻转,在三个模型中的两个上,逐头补丁同样无效(Qwen为0/12600次前向补丁)。唯一例外是InternVL3第20层第2个头,这是一个非词汇、自注意力头,其效应局限于该特定头。尽管存在这一零结果,错误仍可在操作层面分为感知失败、编码但失联、先验覆盖三种失效模式,在三种架构上均能以超过60%的准确率学习区分,且架构的先验方向可预测两种干预中哪一种会引发类别特异性响应。作者强调这些缓解效应是在真实标签下报告的,用以证明类别的机制真实性,而非作为可部署方法。

🔑 关键词速览

POPE一个用于评估视觉-语言模型对象幻觉的基准测试,通过询问图像中是否存在特定对象来检测模型是否产生幻觉。
残差流修补一种因果干预技术,通过替换或修改模型残差流中的激活值来测试特定层或组件对最终预测的因果影响。
编码但失联一种失败模式,指模型中间层编码了正确答案信息,但该信息未能因果地影响最终预测,导致错误输出。
先验覆盖一种失败模式,指模型依赖训练数据中的先验知识或偏见,覆盖了从输入中感知到的实际信息,从而产生错误。
感知失败一种失败模式,指模型未能正确感知或提取输入图像中的关键视觉信息,导致后续推理和预测错误。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅