🔥 今日值得一读 首个专为知识型视觉问答打造的MLLM检索器,Recall@1暴增14.7%!
Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering
arXiv CV (cs.CV) 🔥 重点 #视觉问答#检索增强#多模态 🕐 08-25 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用KBMR替代CLIP检索,实现实体级语义对齐,提高长尾知识问答准确性。

📖 AI 总结

该研究针对知识型视觉问答(KB-VQA)中外部信息检索的局限性,提出了一种名为KBMR的新型检索模型。现有方法多依赖CLIP风格的双编码器,仅关注表面视觉相似性,难以应对概念相同但外观差异大或不同实体外观相近的情况。KBMR首次将多模态大语言模型(MLLM)用作嵌入检索器,利用其自回归能力将图像映射至更保留概念身份的语义空间。为处理维基百科规模检索中的噪声监督问题,研究引入基于MLLM的语义判别器,生成连续实体一致性权重,并设计连续语义蒸馏目标,实现有效硬负样本采样和软监督。实验显示,KBMR在检索Recall@1上较CLIP基线提升最高14.7%,端到端VQA准确率提升9.4%,验证了实体级语义对齐对知识型问答检索的有效性。该工作已被ACM MM 2026接收。

🔑 关键词速览

KB-VQA基于知识的视觉问答,需要检索外部知识来回答涉及长尾实体的问题。
MLLM多模态大语言模型,能够处理图像和文本并生成语义丰富的表示。
CLIP对比语言-图像预训练模型,使用双编码器进行视觉和文本的对比学习。
实体对齐检索一种检索方法,强调在实体级别进行语义对齐,而非仅依赖表面视觉相似性。
连续语义蒸馏一种训练目标,利用连续的实体一致性权重进行软监督,以处理噪声标签。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅