本文提出SAGE(Schema-Guided Aspect-Based Grant Evaluation),一个将资助评审标准转化为结构化检查项、并把评审判断与申请材料中的证据相链接的大语言模型系统,旨在生成可供同行核查的评审意见。研究分两阶段在35份非营利组织资助申请上进行评估:与原始评审中105份意见的回顾性对比显示,SAGE与人类评审达到中等程度的有序一致性(kappa=0.29);随后评审方在查看SAGE输出后进行逐条重新评审,产生202份评估,此时一致性提升至kappa=0.58,并优于逐条提示的基线方法(共同子集上kappa=0.33),排名相关更高、误差更低。此外,系统还通过主张级审计区分结构化草稿中被确认、有争议和未处理的部分。该工作将评审方法论操作化,为专家修正提供详细、证据可追溯且可审计的评审草稿。
| SAGE | 一种模式引导的基于方面的资助评估系统,将评审标准转化为结构化检查项并关联申请材料中的证据。 |
| Schema-Guided | 模式引导,指利用预定义的结构化模式(如评审标准框架)来指导大语言模型的评估过程。 |
| Aspect-Based Grant Evaluation | 基于方面的资助评估,将资助评审分解为多个具体评估方面或标准进行逐项判断。 |
| kappa | 科恩卡帕系数,衡量评审者之间或系统与人类评审之间一致性的统计指标,取值越高表示一致性越强。 |
| claim-level audit | 声明级别审计,对结构化草案中的每条具体判断或声明进行核查,区分已确认、有争议和未处理的内容。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅