国际法文本长期缺乏词元级别的命名实体识别资源。该研究构建了IntLawNER数据集与基准,涵盖国际法院判决、联合国安理会决议和欧洲人权法院判决,包含2987句金标注句子和8094个实体跨度,涉及七种机构特定实体类型。数据构建采用混合算法与智能体流水线,将46.8万源句压缩为紧凑标注集,89.6%的金标注跨度未经修改即被采纳。研究揭示,人机聚合一致性指标在领域特定NER中可能产生误导:边界匹配跨度的科恩卡帕系数达0.964,但纳入缺失实体、边界错误和标签修正后宏观F1仅为0.753。基准测试显示,零样本GLiNER在依赖机构职能而非表面形式的实体类型上表现崩溃,微调Transformer在稀有标签上亦表现不佳;精选的少样本示例可提升所有大语言模型表现,Claude Opus 4.6取得最佳微F1值0.873。该资源为国际法律文本引用抽取提供了可复用基准。
| IntLawNER | 本文提出的国际法领域命名实体识别数据集与基准,涵盖国际法院、联合国安理会和欧洲人权法院的文本。 |
| 命名实体识别 (NER) | 自然语言处理任务,旨在识别文本中具有特定意义的实体,如人名、机构名、法律引用等。 |
| GLiNER | 一种基于跨度的零样本命名实体识别模型,无需针对特定实体类型进行训练即可识别实体。 |
| micro-F1 | 一种综合评估指标,通过计算所有类别的总精确率和召回率的调和平均来衡量模型整体性能。 |
| 少样本提示 (few-shot prompting) | 在提示大语言模型时提供少量示例,以引导模型更好地完成特定任务的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅