该研究聚焦多模态实体链接中的罕见实体识别问题,指出以往研究主要依赖页面浏览量等流行度指标衡量实体稀有性,而本文引入知识图谱结构指标,以捕捉实体在文档记录和关联程度上的不足,从而识别出流行度指标遗漏的大量罕见实体。研究发现,在不同稀有性定义下,当前最优系统的准确率下降15.4%至39.9%,表明不同定义揭示了不同的失败模式。为此,作者提出一种无需训练的框架,让具备推理能力的视觉语言模型迭代检索并推理维基百科内容,动态收集证据。实验表明,推理与检索具有互补性:单独推理对罕见实体提升有限,单独检索虽能改善罕见实体表现却可能损害整体准确率,二者结合效果最佳。在覆盖五种语言的MERLIN基准上,该系统整体超越当前最优水平6.9%,在罕见实体切片上提升最高达23.3%,并发布了MERLIN-Rare测试集以支持针对性评估。
| 多模态实体链接 | 将文本和图像中的实体提及链接到知识库条目的任务。 |
| 知识图谱结构指标 | 基于知识图谱中实体的连接和文档化程度来衡量稀有性的度量。 |
| 视觉语言模型 | 能够同时处理视觉和语言信息的人工智能模型。 |
| MERLIN | 一个多语言多模态实体链接基准,涵盖五种语言。 |
| MERLIN-Rare | 针对稀有实体评估的测试切片,用于针对性评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅