资助评审AI系统SAGE:35份申请实测,与基金会复评一致性kappa达0.58,碾压单提示基线!
SAGE: Schema-Guided LLMs for Grant Review
arXiv CL (cs.CL) 大模型评估应用 🕐 今天 12:00

📖 AI 总结

本文提出SAGE(Schema-Guided Aspect-Based Grant Evaluation),一个将资助评审标准转化为结构化检查项、并把评审判断与申请材料中的证据相链接的大语言模型系统,旨在生成可供同行核查的评审意见。研究分两阶段在35份非营利组织资助申请上进行评估:与原始评审中105份意见的回顾性对比显示,SAGE与人类评审达到中等程度的有序一致性(kappa=0.29);随后评审方在查看SAGE输出后进行逐条重新评审,产生202份评估,此时一致性提升至kappa=0.58,并优于逐条提示的基线方法(共同子集上kappa=0.33),排名相关更高、误差更低。此外,系统还通过主张级审计区分结构化草稿中被确认、有争议和未处理的部分。该工作将评审方法论操作化,为专家修正提供详细、证据可追溯且可审计的评审草稿。

🔑 关键词速览

SAGE一种模式引导的基于方面的资助评估系统,将评审标准转化为结构化检查项并关联申请材料中的证据。
Schema-Guided模式引导,指利用预定义的结构化模式(如评审标准框架)来指导大语言模型的评估过程。
Aspect-Based Grant Evaluation基于方面的资助评估,将资助评审分解为多个具体评估方面或标准进行逐项判断。
kappa科恩卡帕系数,衡量评审者之间或系统与人类评审之间一致性的统计指标,取值越高表示一致性越强。
claim-level audit声明级别审计,对结构化草案中的每条具体判断或声明进行核查,区分已确认、有争议和未处理的内容。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅