零训练BM25+LLM选实体,消歧准确率暴涨4%,新SOTA!
Select, Don't Train: The Benefits of Modular Entity Disambiguation with LLM-Based Selection
arXiv CL (cs.CL) 重要 #知识图谱#LLM#实体消歧 🕐 08-31 12:00

📖 AI 总结

该研究系统比较了实体消歧任务中检索与选择两个阶段的组合方式,提出将候选实体生成与LLM选择解耦的模块化框架。实验表明,当选择阶段交由能力较强的LLM处理时,训练检索器的边际收益有限:无需训练的BM25检索器配合LLM选择器在ZELDA基准上达到86.3的inKB微F1值,较此前最优提升4个百分点;搭配训练密集检索器则进一步提升至88.5。此外,该框架支持在检索失败时主动弃权,避免强制预测错误实体,在奖励正确弃权的评估设置下,BM25+LLM管线达到90.7的F1值。研究揭示了当前ED系统在候选缺失场景下的固有局限,并为构建更灵活、可维护的知识图谱消歧流程提供了新思路。

🔑 关键词速览

Entity Disambiguation (ED)实体消歧,指在文本中识别实体并将其链接到知识图谱中正确实体的任务。
Dual-encoder models双编码器模型,一种使用两个编码器分别处理查询和候选实体,并在共享嵌入空间中进行匹配的神经网络架构。
BM25BM25是一种经典的稀疏检索算法,基于词频和逆文档频率进行相关性排序,无需训练。
LLM-based selector基于大语言模型的选择器,利用LLM的推理能力从候选实体中选出正确的实体。
ZELDA benchmarkZELDA是一个用于评估实体消歧系统的基准数据集,包含知识图谱内和知识图谱外的实体。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅