🔥 今日值得一读 LLM评审竟给被拒论文打7分?人类只给3.4分,检测错误率仅12%!
Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects
arXiv CL (cs.CL) 🔥 重点 多模态安全对齐大模型 🕐 09-01 12:00

📖 AI 总结

该研究系统评估了两种多模态大语言模型(Qwen2.5-VL-72B和Pixtral-Large-124B)在同行评审任务中的表现,涉及165篇ICLR 2026投稿。研究发现,LLM的评分范围(7.0-8.1)显著高于人类评审(3.4-6.8),存在明显的评分校准偏差。在错误检测方面,模型在自然提示下仅识别出12.1%的植入错误,加入验证指令后提升至22.2%,但仍有78%的错误未被发现。值得注意的是,提供图表反而降低了错误检测率,且模型在纯文本条件下会虚构不存在的图表内容。作者身份(高威望或低威望机构)对评分和错误检测均无影响,表明模型未受作者偏见干扰。此外,LLM的编辑决策与简单分数平均的结果完全一致,缺乏更精细的判断能力。该研究揭示了当前LLM在学术评审中的关键局限,尤其是评分校准失真和视觉信息处理不足的问题。

🔑 关键词速览

多模态LLMs能够处理和理解多种类型数据(如文本和图像)的大型语言模型。
同行评审学术出版中,由领域专家对提交的论文进行评估的过程。
评分校准模型给出的评分与人类评审者评分的一致性程度。
错误检测模型识别稿件中错误(如逻辑、事实或格式错误)的能力。
作者身份效应作者的身份或所属机构对评审结果产生的影响。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅