本文介绍了一个名为 LitReview Arena 的文献综述智能体评估平台。针对自动生成的文献综述难以用传统参考重叠指标衡量其研究价值的问题,该平台采用“对战式”同行评审协议:具备AI论文写作经验的领域专家在各自专长范围内,对匿名综述草稿进行五个文献综述特有维度的评分。研究收集了约3000条专家判断,发现当前最强系统在整体效用上仅能战胜人类草稿的23.0%对决,而Sonar Deep Research等智能体大语言模型比基础模型表现提升超过60%。研究还揭示现有LLM-as-a-judge方法与人类专家判断存在显著偏差(斯皮尔曼相关系数仅0.467),尤其在论文结构和研究建议等综合维度上。基于收集的偏好数据,作者训练了专家校准评估器LitJudge,将一致性提升至0.78,接近专家间一致性水平,代码和数据已公开。
| LitReview Arena | 一个战斗式评估平台,用于比较文献综述生成系统的性能。 |
| battle-style evaluation | 一种评估方法,通过让两个系统生成的结果进行对比,由专家评判优劣。 |
| LLM-as-a-judge | 使用大型语言模型作为评判者来评估其他模型输出的方法。 |
| agentic LLM | 具有自主规划和执行能力的智能体型大型语言模型,如Sonar Deep Research。 |
| Spearman's rho | 斯皮尔曼等级相关系数,用于衡量两个排序之间的一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅