🔥 今日值得一读 别再只看图!反事实干预让VQA标注成本暴降,域外性能最稳提升
Don't Just Look, Intervene: Perturbation Based Region Labeling for VQA Images
arXiv CV (cs.CV) 🔥 重点 #VQA#视觉定位#可解释性#反事实 🕐 09-15 12:00
👨‍💼 主理人解读 · 为什么值得关注
自动标注真正影响答案的图像区域,开发者可用它低成本获得VLM视觉推理的因果监督信号。

📖 AI 总结

这篇论文关注视觉语言模型(VLM)在视觉问答(VQA)任务中的视觉推理监督问题。作者指出,模型本应依赖真正决定答案的视觉证据,但现有区域标注要么人工成本高昂,要么依赖特定数据集的标注体系。为此,论文提出“模型因果视觉证据”这一新的标注目标,将其定义为:对图像区域施加反事实干预后能够改变模型答案分布的区域集合。基于该原则,作者设计了CSGR(反事实搜索定位区域)流程,通过候选区域生成、扰动、答案敏感性测量以及多评判者证据聚合,近似出对答案起关键作用的区域。为验证标注信号的有效性,作者将其接入注意力引导、视觉思维链微调和潜在视觉推理三种既有训练方法。实验表明,在多种自动区域标注机制中,CSGR标注在域内和域外评估中相对仅用交叉熵微调均取得最一致的提升,说明该方案能捕捉有用的区域级信息,为视觉推理的监督提供了可扩展的新思路。

🔑 关键词速览

Vision Language Models (VLMs)视觉语言模型,能够同时处理图像和文本输入并生成文本输出的多模态模型。
Counterfactual Intervention反事实干预,通过修改输入(如遮挡图像区域)来观察模型输出变化,以推断因果关系。
Counterfactual Search for Grounding Regions (CSGR)面向基础区域的反事实搜索,一种通过扰动候选区域并聚合多评判者证据来标注答案关键区域的流程。
Visual CoT Finetuning视觉思维链微调,一种在微调过程中引导模型生成中间视觉推理步骤的训练方法。
Latent Visual Reasoning潜在视觉推理,在模型的潜在空间中进行视觉推理,而非显式生成推理步骤。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅