中文军事新闻首个联合抽取基准CMNIE发布,1.3万实例标注7类事件8类关系!
CMNIE: An Information Extraction Benchmark for Chinese Military News
arXiv CL (cs.CL) 论文方法大模型 🕐 09-11 12:00

📖 AI 总结

本文介绍了CMNIE,一个面向中文军事新闻的信息抽取基准数据集。针对该领域缺乏联合信息抽取资源的问题,CMNIE在统一领域模式(schema)下,对事件触发词、事件论元、命名实体和实体关系进行联合标注,突破了以往仅停留在文档级事件标注的局限。数据集包含从公开中文军事新闻中采集的13000条实例,人工标注涵盖7种事件类型、10种论元角色、7种实体类型和8种关系类型。研究者在统一测试集上评估了监督式信息抽取模型、零样本大语言模型以及基于微调大语言模型的抽取方法。实验结果显示,CMNIE仍具挑战性,尤其在关系抽取和事件论元跨度的精确匹配方面;零样本大语言模型虽能识别相关语义单元,却难以精确匹配金标准跨度边界。该基准为研究专业中文新闻中的模式遵循、精确跨度匹配与联合结构化抽取提供了标准化平台。

🔑 关键词速览

CMNIE本文提出的中文军事新闻信息抽取基准数据集,联合标注事件、论元、实体和关系。
联合信息抽取在同一框架下同时抽取事件、论元、实体和关系等多种结构化信息,而非分别独立处理。
事件论元描述事件参与者的语义角色,如时间、地点、施事者等,是事件抽取的关键要素。
零样本大语言模型无需针对特定任务进行微调,直接利用预训练大语言模型完成抽取任务的方法。
精确跨度匹配要求抽取结果与人工标注的文本片段边界完全一致,是评价信息抽取性能的严格标准。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅