AI审稿意见验证准确率仅24%,Peerify用800条真实评审数据揭示痛点!
Peerify: Benchmarking Peer-Review Claim Verification
arXiv CL (cs.CL) 重要 论文方法Agent评测 🕐 今天 12:00

📖 AI 总结

本文提出 Peerify,一个面向同行评审意见的稿件溯源验证流程。该流程将评审意见拆解为原子化论断,检索稿件中的相关证据,并判断每条论断是否得到论文支持。为支撑开发与评估,作者构建了包含800条论断的基准数据集,来源于NeurIPS 2024和ICLR 2024的真实评审互动,其中300条经人工标注用于审核自动监督信号。研究评估了当前先进语言模型与检索策略,并对比了蕴含基线模型。结果显示,以检索为中心的验证和论断拆解至关重要,而模糊、解释性强的评审意见仍是主要挑战。自动标签与人工共识的一致率达90.3%(κ=0.87),而现成蕴含模型的宏F1均低于0.24,表明该任务对现有方法仍具显著难度。

🔑 关键词速览

Peerify本文提出的一个流程,用于基于稿件证据自动验证同行评审意见中的主张是否成立。
原子性主张将评审意见分解后得到的最小、不可再分的独立断言单元。
蕴含基线基于自然语言推理中蕴含关系判断的基准模型,用于判断证据是否支持主张。
宏平均 F1一种分类评估指标,先计算每个类别的 F1 值再取平均,能平等对待各类别。
以检索为中心的验证一种验证思路,强调先从稿件中检索相关证据,再基于证据判断主张是否成立。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅