该研究探讨事实核查联合评分提升时,增益究竟来自答案改进还是证据改进。作者在FEVEROUS数据集上,基于四个训练过的DeBERTa检查点和7890条声明发现,将DCUF证据替换为UnifEE证据后,严格评分提升9.61个百分点,而答案准确率仅提升1.96个百分点,严格评分增益的配对95%置信区间为[8.77, 10.43]。仅替换送入评分器的证据即可解释7.92至9.08个百分点的增益。为考察该证据增益对评估设置的依赖,作者用两个8B大模型在FEVER、FEVEROUS和SciFact上生成47万余条回答,发现上下文从256增至2048词元时,固定答案下的证据增益在FEVEROUS上分别提升3.84和3.10个百分点。研究意义在于揭示聚合准确率与证据覆盖率会掩盖声明层面的真实变化,需借助答案与证据的四种组合才能分辨评分提升的来源。
| FEVEROUS | 一个用于事实核查的数据集,要求同时验证声明并识别支持或反驳的证据。 |
| 严格分数 (strict score) | 在FEVEROUS中,指提交证据中同时具有正确答案和完整标注证据组的声明百分比。 |
| DeBERTa | 一种基于Transformer的预训练语言模型,常用于自然语言理解任务,此处作为训练好的事实核查检查点。 |
| DCUF / UnifEE | 两种不同的证据选择或生成方法,用于为事实核查提供证据。 |
| 上下文预算 (context budget) | 指在生成答案时提供给大语言模型的上下文标记数量限制,如256或2,048个标记。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅