新基准TestHallVQA专治LVLMs文档级推理,还提出F1-R2量化冗余鲁棒性!
TestHallVQA: Exploring LVLMs' Document-Level Reasoning under Redundant Contexts from Scientific Exams
arXiv CL (cs.CL) 重要 多模态论文方法 🕐 09-15 12:00

📖 AI 总结

本文提出TestHallVQA,一个面向大型视觉语言模型(LVLMs)的多图像视觉问答基准,旨在同时考察文档级规模理解与科学考试级别的高难度推理。作者指出,现有平面媒体VQA基准往往割裂了长文档理解与复杂视觉推理,且多局限于单页、无噪声场景;通过理论分析,他们发现无关视觉token会显著降低模型性能,但此前缺乏系统量化。为此,TestHallVQA支持可控注入多层级上下文冗余,并据此提出新指标F1-R²,联合衡量模型的推理能力与在文档级冗余下的证据检索鲁棒性。对主流LVLMs的广泛实验揭示了其在多个维度上的潜在缺陷,为后续研究提供了具体方向。

🔑 关键词速览

LVLMs大型视觉-语言模型,能够同时处理视觉和文本信息,用于视觉问答等任务。
VQA视觉问答,一种涉及图像和问题的任务,模型需根据图像内容回答问题。
TestHallVQA本文提出的多图像视觉问答基准,模拟人类考试难度,用于评估文档级推理。
F1-R²新提出的度量标准,联合量化模型的计算推理能力和对文档级冗余的证据检索鲁棒性。
上下文冗余在文档中注入的多余或无关信息,用于测试模型在噪声环境下的鲁棒性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅