本文提出 Peerify,一个面向同行评审意见的稿件溯源验证流程。该流程将评审意见拆解为原子化论断,检索稿件中的相关证据,并判断每条论断是否得到论文支持。为支撑开发与评估,作者构建了包含800条论断的基准数据集,来源于NeurIPS 2024和ICLR 2024的真实评审互动,其中300条经人工标注用于审核自动监督信号。研究评估了当前先进语言模型与检索策略,并对比了蕴含基线模型。结果显示,以检索为中心的验证和论断拆解至关重要,而模糊、解释性强的评审意见仍是主要挑战。自动标签与人工共识的一致率达90.3%(κ=0.87),而现成蕴含模型的宏F1均低于0.24,表明该任务对现有方法仍具显著难度。
| Peerify | 本文提出的一个流程,用于基于稿件证据自动验证同行评审意见中的主张是否成立。 |
| 原子性主张 | 将评审意见分解后得到的最小、不可再分的独立断言单元。 |
| 蕴含基线 | 基于自然语言推理中蕴含关系判断的基准模型,用于判断证据是否支持主张。 |
| 宏平均 F1 | 一种分类评估指标,先计算每个类别的 F1 值再取平均,能平等对待各类别。 |
| 以检索为中心的验证 | 一种验证思路,强调先从稿件中检索相关证据,再基于证据判断主张是否成立。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅