536篇论文AI自动综述,GPT-5准确率81.67%,完胜人工还快!
Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models
arXiv AI (cs.AI) 重要 #LLM应用#文献综述#信息提取 🕐 08-28 12:00

📖 AI 总结

该研究探讨了利用大型语言模型(LLMs)自动化系统文献综述(SLR)的可行性,聚焦于疾病传播模型领域。研究者开发了一个LLM流水线,从536篇同行评审的基于代理建模论文中提取模型相关信息,并与人工综述结果进行对比。结果显示,GPT-4.1的论文级准确率约为77.95%,GPT-5.0达到81.67%;字段级准确率介于32.40%至100%之间,复杂或主观性强的字段表现较差。研究还发现,LLM间的一致性可作为输出质量的潜在指标:低一致性可能暗示幻觉,而高一致性伴随低准确率则可能反映人工数据集中的噪声或错误。该工作为提示词开发提供了实践见解,同时明确了LLM在建模与仿真领域全面开展SLR的优势与局限,对推动研究流程自动化具有参考意义。

🔑 关键词速览

Large Language Models (LLMs)大型语言模型,如GPT系列,能够理解和生成自然语言,用于自动化文本处理任务。
Systematic Literature Review (SLR)系统性文献综述,一种结构化、可重复的文献评估方法,用于综合特定主题的研究证据。
Agent-Based Modeling (ABM)基于代理的建模,一种模拟个体行为及其交互以研究系统涌现现象的建模方法。
Hallucination幻觉,指LLM生成不基于输入或事实的虚假信息,影响输出可靠性。
Prompt Development提示开发,指设计输入指令以引导LLM生成特定输出的过程,对任务性能至关重要。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅