这篇论文研究视觉语言模型(VLM)在视觉信息被拆分、裁剪或逐步呈现时的表现,并提出新基准 Layered-VQA,包含 93 个场景、300 个问题,每张图像被分解为可精确重组的 RGBA 图层,每个问题标注了支持层、最小充分层和干扰层。研究评估了 11 个开源模型(3B 至 32B)和 2 个专有模型,共 187,200 轮对话,并由 174 万次跨模型判断评分。结果发现三类一致失败:一是组合损失,拆分问题影响较小,但拆分场景会显著降低准确率,重新组合图层后性能基本恢复;二是预言机反转,即使提供经筛选的充分证据,表现也可能不如完整场景;三是 grounding 损失,所需证据越多,定位能力下降远快于答案准确率。研究说明,仅提供正确的视觉证据并不够,证据如何组合与呈现,才是模型能否有效利用和定位它的关键。
| Layered-VQA | 一种新的视觉问答基准,将图像分解为有序的 RGBA 图层,用于研究信息碎片化对模型的影响。 |
| VLM | 视觉语言模型,能够同时处理视觉和文本信息并进行推理的 AI 模型。 |
| RGBA 图层 | 包含红、绿、蓝颜色通道和透明度通道的图像图层,可精确重组原始场景。 |
| Oracle Inversion | 预言机反转,指即使提供由预言机选择的充分证据,模型性能也可能比完整场景更差的现象。 |
| Grounding | 接地,指模型将语言表达与视觉证据中的具体区域或对象正确关联的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅