🔥 今日值得一读 VLM碎片化场景准确率暴跌!93场景30万次对话揭示组合损失
Composition, Not Conversation: VLMs Lose the Scene, Not the Thread
arXiv CV (cs.CV) 🔥 重点 #VQA#评测基准#VLM 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮你诊断VLM在分块、逐步揭示图像时的推理短板,指导多模态系统设计。

📖 AI 总结

这篇论文研究视觉语言模型(VLM)在视觉信息被拆分、裁剪或逐步呈现时的表现,并提出新基准 Layered-VQA,包含 93 个场景、300 个问题,每张图像被分解为可精确重组的 RGBA 图层,每个问题标注了支持层、最小充分层和干扰层。研究评估了 11 个开源模型(3B 至 32B)和 2 个专有模型,共 187,200 轮对话,并由 174 万次跨模型判断评分。结果发现三类一致失败:一是组合损失,拆分问题影响较小,但拆分场景会显著降低准确率,重新组合图层后性能基本恢复;二是预言机反转,即使提供经筛选的充分证据,表现也可能不如完整场景;三是 grounding 损失,所需证据越多,定位能力下降远快于答案准确率。研究说明,仅提供正确的视觉证据并不够,证据如何组合与呈现,才是模型能否有效利用和定位它的关键。

🔑 关键词速览

Layered-VQA一种新的视觉问答基准,将图像分解为有序的 RGBA 图层,用于研究信息碎片化对模型的影响。
VLM视觉语言模型,能够同时处理视觉和文本信息并进行推理的 AI 模型。
RGBA 图层包含红、绿、蓝颜色通道和透明度通道的图像图层,可精确重组原始场景。
Oracle Inversion预言机反转,指即使提供由预言机选择的充分证据,模型性能也可能比完整场景更差的现象。
Grounding接地,指模型将语言表达与视觉证据中的具体区域或对象正确关联的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅