4.5万标注数据!新基准框架专治系统综述筛选,LLM评估不再被不平衡数据坑
A Benchmark Framework for Screening Automation in Systematic Reviews
arXiv CL (cs.CL) 重要 #评测基准#LLM#系统综述 🕐 今天 12:00

📖 AI 总结

该论文针对系统综述筛选阶段耗时耗力的问题,提出利用大语言模型辅助文章相关性分类,并指出现有评估方法在高度不平衡的筛选场景下容易产生误导。为此,作者构建了包含45064条标注数据的基准数据集,覆盖32项精选二次研究,并提出一套考虑类别不平衡的评估框架,同时推出支持提示词实验、实验管理与结果分析的工具PromptSR。论文还通过用例展示了SRBench与PromptSR的实际应用。该工作为系统综述筛选自动化提供了更可靠的评测基准与工具支持,有助于推动LLM在该领域的规范化评估与落地。

🔑 关键词速览

Systematic Reviews (SR)系统综述,一种遵循严格方法学、全面收集和综合特定研究问题所有相关证据的研究方法。
Large Language Models (LLMs)大型语言模型,基于海量文本数据训练、能够理解和生成自然语言的深度学习模型,如GPT系列。
Class Imbalance类别不平衡,指数据集中不同类别的样本数量差异很大,在系统综述筛选中表现为排除文章远多于纳入文章。
SRBench本文提出的系统综述筛选基准数据集,包含45,064条标注条目,用于评估LLM在系统综述筛选中的性能。
PromptSR本文提出的工具,用于支持基于LLM的系统综述筛选中的提示实验、实验管理和结果分析。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅