仅凭裁决训练AI,证据恢复F1飙至0.564,准确率0.896!
Verdicts Without Annotated Evidence: Rejection Sampling or Label-Only Post-Training for Evidence Recovery?
arXiv CL (cs.CL) 重要 #后训练#证据检索#评测 🕐 今天 12:00

📖 AI 总结

该研究关注审核流程中仅有裁决结果、缺乏证据标注的现实场景,探讨小型语言模型能否仅凭裁决标签恢复支撑证据。作者在ContractNLI数据集上将人工证据跨度留作评估,比较两种无标注训练策略:纯标签训练与拒绝采样。结果显示,纯标签训练达到0.896的准确率和0.564的跨度F1,拒绝采样为0.797和0.556,均优于训练前的0.747和0.493;逐字引用率也从0.597分别提升至0.729和0.701。研究还发现,匹配裁决与匹配证据跨度并非同一回事,二者相关性弱且对系统的排序不同,说明准确率不足以衡量引用可审核性。作者强调单语料单随机种子尚不足以判定优劣,但两种方法都能在无人标注证据的情况下改善证据恢复。

🔑 关键词速览

ContractNLI一个用于自然语言推理的合同数据集,包含人工标注的证据片段,常用于评估模型在合同审查中的表现。
Rejection Sampling一种训练方法,仅保留那些生成的裁决与记录匹配的生成轨迹,然后根据自动源接地分数选择最佳轨迹。
Label-Only Post-Training仅使用裁决标签(无证据标注)对语言模型进行后训练的方法。
Span F1用于评估模型预测的证据片段与人工标注片段之间重叠程度的F1分数。
Verbatim Citation模型生成的引用与源文本逐字匹配的程度,用于衡量引用的准确性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅