🔥 今日值得一读 LLM做系统综述有多强?新基准实测:筛选效率提升28.8%,但证据提取仅恢复30%!
SciLitBench: Benchmark and Design Principles for LLM-Powered Systematic Literature Reviews
arXiv AI (cs.AI) 🔥 重点 #评测基准#RAG#Agent 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用SciLitBench测试LLM在文献综述各环节的能力,并借鉴其设计原则优化自动化综述工具。

📖 AI 总结

SciLitBench是一个面向大语言模型(LLM)辅助系统文献综述的多阶段基准测试框架,覆盖标题与摘要筛选、全文筛选及基于模式的数据提取三个关键环节。该基准包含42,981条检索记录、1,012篇全文及888篇纳入论文的标注数据。研究对六个模型家族的22个开源权重模型进行评估,发现明确的纳入与排除标准可将标题和摘要筛选的F2分数提升28.8%,研究者撰写的理由说明可使全文筛选性能提高15%。然而,数据提取环节呈现不同的可靠性特征:从出版年份的0.97准确率到计算方法提取的0.37 Jaccard重叠度,性能差异显著,最强模型仅能恢复30%的标注评估证据和25%的局限性描述。SciLitBench揭示了高召回率筛选与完整证据提取之间的实际边界,为可复现的LLM辅助证据综合评估提供了重要资源。

🔑 关键词速览

SciLitBench一个用于评估大语言模型在系统综述中多阶段表现的新基准,涵盖筛选和提取任务。
systematic reviews系统综述,一种通过明确方法全面检索、筛选和综合研究证据的文献综述类型。
title and abstract screening标题与摘要筛选,系统综述中根据标题和摘要快速判断研究是否相关的初步筛选阶段。
full-text screening全文筛选,在初步筛选后对全文进行详细审查以决定最终纳入的阶段。
schema-guided data extraction基于模式的数据提取,按照预定义的结构化模板从文献中提取特定信息的过程。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅