该研究系统评估了两种多模态大语言模型(Qwen2.5-VL-72B和Pixtral-Large-124B)在同行评审任务中的表现,涉及165篇ICLR 2026投稿。研究发现,LLM的评分范围(7.0-8.1)显著高于人类评审(3.4-6.8),存在明显的评分校准偏差。在错误检测方面,模型在自然提示下仅识别出12.1%的植入错误,加入验证指令后提升至22.2%,但仍有78%的错误未被发现。值得注意的是,提供图表反而降低了错误检测率,且模型在纯文本条件下会虚构不存在的图表内容。作者身份(高威望或低威望机构)对评分和错误检测均无影响,表明模型未受作者偏见干扰。此外,LLM的编辑决策与简单分数平均的结果完全一致,缺乏更精细的判断能力。该研究揭示了当前LLM在学术评审中的关键局限,尤其是评分校准失真和视觉信息处理不足的问题。
| 多模态LLMs | 能够处理和理解多种类型数据(如文本和图像)的大型语言模型。 |
| 同行评审 | 学术出版中,由领域专家对提交的论文进行评估的过程。 |
| 评分校准 | 模型给出的评分与人类评审者评分的一致性程度。 |
| 错误检测 | 模型识别稿件中错误(如逻辑、事实或格式错误)的能力。 |
| 作者身份效应 | 作者的身份或所属机构对评审结果产生的影响。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅