首个跨5大学科真实编辑决策的同行评审数据集来了!覆盖3668条记录,专家评审平均2155词,比会议评审更硬核!
FIRSTPASS: A Multi-Domain, Multi-Round Peer Review Dataset Grounded in Real Editorial Outcomes
arXiv CL (cs.CL) 重要 数据集科学评审大模型 🕐 08-28 12:00

📖 AI 总结

该研究提出了FIRSTPASS,这是首个基于多学科高影响力期刊完整多轮编辑对话构建的同行评审数据集。现有评审数据集仅覆盖计算机科学和机器学习领域,导致AI评审模型缺乏跨学科能力。FIRSTPASS从Nature Communications的强制性透明同行评审中整理了3668条记录,涵盖生物学、化学、神经科学、物理学和地球科学五个领域,完整保留了从初始审稿报告、作者逐点回复到更新后评审意见的迭代过程。每条记录都带有基于真实编辑决策的结果标签(标准两轮或扩展三轮以上),提供了以往语料库所缺乏的基准真值。自动化审计确认内容完整性达100%,专家评审平均2155词,密度显著高于会议评审。该数据集及配套工具已公开,旨在推动跨学科AI科学判断的可复现基准测试。

🔑 关键词速览

FIRSTPASS一个多领域、多轮同行评审数据集,基于真实编辑结果构建,用于训练和评估AI科学判断能力。
peer review dataset同行评审数据集,包含审稿人报告、作者回复和编辑决策等记录,用于研究或训练AI模型。
transparent peer review透明同行评审,一种公开审稿人报告和作者回复的评审模式,旨在提高评审过程的开放性。
editorial decisions编辑决策,指期刊编辑根据审稿意见和作者回复做出的最终录用或拒稿决定。
ground truth基准真相,指用于验证模型或系统性能的已知正确结果或标签。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅