本文介绍了CMNIE,一个面向中文军事新闻的信息抽取基准数据集。针对该领域缺乏联合信息抽取资源的问题,CMNIE在统一领域模式(schema)下,对事件触发词、事件论元、命名实体和实体关系进行联合标注,突破了以往仅停留在文档级事件标注的局限。数据集包含从公开中文军事新闻中采集的13000条实例,人工标注涵盖7种事件类型、10种论元角色、7种实体类型和8种关系类型。研究者在统一测试集上评估了监督式信息抽取模型、零样本大语言模型以及基于微调大语言模型的抽取方法。实验结果显示,CMNIE仍具挑战性,尤其在关系抽取和事件论元跨度的精确匹配方面;零样本大语言模型虽能识别相关语义单元,却难以精确匹配金标准跨度边界。该基准为研究专业中文新闻中的模式遵循、精确跨度匹配与联合结构化抽取提供了标准化平台。
| CMNIE | 本文提出的中文军事新闻信息抽取基准数据集,联合标注事件、论元、实体和关系。 |
| 联合信息抽取 | 在同一框架下同时抽取事件、论元、实体和关系等多种结构化信息,而非分别独立处理。 |
| 事件论元 | 描述事件参与者的语义角色,如时间、地点、施事者等,是事件抽取的关键要素。 |
| 零样本大语言模型 | 无需针对特定任务进行微调,直接利用预训练大语言模型完成抽取任务的方法。 |
| 精确跨度匹配 | 要求抽取结果与人工标注的文本片段边界完全一致,是评价信息抽取性能的严格标准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅