本文提出R2VC,一种面向开放域事实核查的模块化架构,将证据检索、推理、验证与置信度校准解耦,以解决端到端提示方法中检索、推理与不确定性估计相互纠缠、难以诊断和信任的问题。该架构结合基于维基百科的稀疏与稠密混合检索、经监督微调和DPO对齐的生成器、用于候选筛选的外部NLI交叉编码器,以及轻量级序列级校准器,支持引用与弃权。在FEVER数据集上,基于80亿参数骨干模型的R2VC较基线准确率提升13.74%。消融实验表明,验证器候选筛选与置信度校准贡献最大:移除候选筛选后准确率降至76.24%,移除校准后Brier分数几乎翻倍至0.161。对250个错误的人工分析显示,检索失败(尤其是错误实体证据)仍是主要瓶颈。研究表明模块化流水线能同时提升预测准确率与置信度可靠性。
| R2VC | 一种模块化的事实核查架构,包含检索、推理、验证和校准四个步骤。 |
| FEVER | 一个用于事实提取和验证的公开数据集,常用于评估事实核查系统。 |
| DPO | 直接偏好优化,一种通过人类偏好数据微调语言模型的方法。 |
| NLI | 自然语言推理,判断两个句子之间是否存在蕴含、矛盾或中立关系。 |
| Brier score | 一种衡量概率预测准确性的指标,值越低表示校准越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅