该论文针对系统综述筛选阶段耗时耗力的问题,提出利用大语言模型辅助文章相关性分类,并指出现有评估方法在高度不平衡的筛选场景下容易产生误导。为此,作者构建了包含45064条标注数据的基准数据集,覆盖32项精选二次研究,并提出一套考虑类别不平衡的评估框架,同时推出支持提示词实验、实验管理与结果分析的工具PromptSR。论文还通过用例展示了SRBench与PromptSR的实际应用。该工作为系统综述筛选自动化提供了更可靠的评测基准与工具支持,有助于推动LLM在该领域的规范化评估与落地。
| Systematic Reviews (SR) | 系统综述,一种遵循严格方法学、全面收集和综合特定研究问题所有相关证据的研究方法。 |
| Large Language Models (LLMs) | 大型语言模型,基于海量文本数据训练、能够理解和生成自然语言的深度学习模型,如GPT系列。 |
| Class Imbalance | 类别不平衡,指数据集中不同类别的样本数量差异很大,在系统综述筛选中表现为排除文章远多于纳入文章。 |
| SRBench | 本文提出的系统综述筛选基准数据集,包含45,064条标注条目,用于评估LLM在系统综述筛选中的性能。 |
| PromptSR | 本文提出的工具,用于支持基于LLM的系统综述筛选中的提示实验、实验管理和结果分析。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅