该论文提出了CrossModalQA,一个面向多模态检索增强生成(RAG)的开域基准,旨在评估模型在异构文本与图像语料上的跨模态、多跳推理能力。基准包含1863个问答对,源自4987篇维基百科文章和4431张维基共享资源图片,覆盖五种推理路径,平均推理深度达3.5跳。研究发现,现有RAG系统难以恢复完整证据链,且在不完整检索引入干扰信息时,性能可能低于闭卷模型。进一步分析表明,完整的跨模态检索对答案准确率的贡献大于生成器规模扩展,而多图像检索与推理是限制端到端性能的主要瓶颈。该工作填补了现有基准在开放域证据发现和复杂跨模态路径上的空白,为多模态RAG的评估与发展提供了重要参考。
| CrossModalQA | 本文提出的开放域多模态问答基准,用于评估跨模态检索和推理。 |
| Multimodal Retrieval-augmented Generation (RAG) | 一种结合外部文本和图像检索来增强多模态大语言模型生成能力的技术。 |
| Multimodal Large Language Models (MLLMs) | 能够处理和理解多种模态(如文本和图像)的大语言模型。 |
| Multi-hop reasoning | 需要多个推理步骤,跨越多个证据片段来回答问题。 |
| Knowledge graph-guided subgraph sampling | 一种利用知识图谱结构来选取相关子图以构建基准数据的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅