本文提出一种弱监督框架,用于从强迫流离失所及脆弱、冲突与暴力(FCV)相关文档中自动抽取数据集提及。针对该领域缺乏人工标注语料的问题,作者先用通用研究文献训练轻量模型,从无标注领域文档中生成候选提及,再由前沿大语言模型结合上下文进行验证、剔除并修正抽取边界,随后补充合成与对比样本,微调轻量模型以实现大规模抽取。在涵盖研究、人道主义和业务文档的1706段独立金标准基准上,模型在提及级别达到74.1%精确率和70.5%召回率,在含数据集引用的段落中精确率达89.5%;段落级判别准确率为88.2%,特异性为88.6%。该工作为标注数据稀缺条件下构建领域专用监督提供了可行路径,也为系统追踪流离失所数据的使用状况、识别数据可用性与传播缺口奠定了技术基础。
| 弱监督框架 | 一种利用不完整、不精确或含噪声的监督信号来训练模型的方法,避免大规模人工标注。 |
| 强迫流离失所 | 指人们因冲突、迫害、灾害等原因被迫离开家园或惯常居住地的现象。 |
| FCV文档 | 指涉及脆弱、冲突与暴力(Fragile, Conflict, and Violence)主题的文档,常见于发展和人道主义领域。 |
| 大语言模型(LLM) | 指参数规模巨大、在海量文本上预训练的语言模型,如GPT系列,具备强大的上下文理解和生成能力。 |
| 金标准基准 | 指由专家人工标注、被公认为高质量且可靠的评估数据集,用于衡量模型性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅