该研究针对知识型视觉问答(KB-VQA)中外部信息检索的局限性,提出了一种名为KBMR的新型检索模型。现有方法多依赖CLIP风格的双编码器,仅关注表面视觉相似性,难以应对概念相同但外观差异大或不同实体外观相近的情况。KBMR首次将多模态大语言模型(MLLM)用作嵌入检索器,利用其自回归能力将图像映射至更保留概念身份的语义空间。为处理维基百科规模检索中的噪声监督问题,研究引入基于MLLM的语义判别器,生成连续实体一致性权重,并设计连续语义蒸馏目标,实现有效硬负样本采样和软监督。实验显示,KBMR在检索Recall@1上较CLIP基线提升最高14.7%,端到端VQA准确率提升9.4%,验证了实体级语义对齐对知识型问答检索的有效性。该工作已被ACM MM 2026接收。
| KB-VQA | 基于知识的视觉问答,需要检索外部知识来回答涉及长尾实体的问题。 |
| MLLM | 多模态大语言模型,能够处理图像和文本并生成语义丰富的表示。 |
| CLIP | 对比语言-图像预训练模型,使用双编码器进行视觉和文本的对比学习。 |
| 实体对齐检索 | 一种检索方法,强调在实体级别进行语义对齐,而非仅依赖表面视觉相似性。 |
| 连续语义蒸馏 | 一种训练目标,利用连续的实体一致性权重进行软监督,以处理噪声标签。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅