本文提出TestHallVQA,一个面向大型视觉语言模型(LVLMs)的多图像视觉问答基准,旨在同时考察文档级规模理解与科学考试级别的高难度推理。作者指出,现有平面媒体VQA基准往往割裂了长文档理解与复杂视觉推理,且多局限于单页、无噪声场景;通过理论分析,他们发现无关视觉token会显著降低模型性能,但此前缺乏系统量化。为此,TestHallVQA支持可控注入多层级上下文冗余,并据此提出新指标F1-R²,联合衡量模型的推理能力与在文档级冗余下的证据检索鲁棒性。对主流LVLMs的广泛实验揭示了其在多个维度上的潜在缺陷,为后续研究提供了具体方向。
| LVLMs | 大型视觉-语言模型,能够同时处理视觉和文本信息,用于视觉问答等任务。 |
| VQA | 视觉问答,一种涉及图像和问题的任务,模型需根据图像内容回答问题。 |
| TestHallVQA | 本文提出的多图像视觉问答基准,模拟人类考试难度,用于评估文档级推理。 |
| F1-R² | 新提出的度量标准,联合量化模型的计算推理能力和对文档级冗余的证据检索鲁棒性。 |
| 上下文冗余 | 在文档中注入的多余或无关信息,用于测试模型在噪声环境下的鲁棒性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅