随着大语言模型能够大规模生成研究想法,科研流程的瓶颈已从想法生成转向想法评估。现有评估方法主要依赖模型的参数化知识或无结构检索,缺乏人类导师那种基于经验的推理依据。为此,研究者提出DeepInstructor,一个将想法评估转化为对结构化学术经验进行推理的智能体框架。该框架基于58607条同行评审构建经验图谱,并利用基于ReAct的智能体检索针对具体评估维度的证据,从而实现可追溯的评估。研究还发布了DeepInstruct数据集,涵盖新颖性、重要性和可行性三个维度的受控成对比较。实验表明,DeepInstructor显著优于现有基线,与人类判断的一致性在Hit@1和Hit@2指标上分别提升24.4%和29.7%。该工作表明,科学想法评估可以建立在对结构化学术经验的显式推理之上。
| DeepInstructor | 本文提出的智能体框架,将研究想法评估转化为对结构化学术经验的推理过程。 |
| Experience Graph | 从大量同行评审中构建的结构化经验图,用于为评估提供可追溯的证据支持。 |
| ReAct-based agent | 基于ReAct范式的智能体,通过交替推理与行动来检索维度特定的评估证据。 |
| DeepInstruct | 本文构建的数据集,包含在新颖性、重要性和可行性维度上的受控成对比较。 |
| Hit@1 / Hit@2 | 评估指标,衡量模型评估结果与人类判断在排名前1或前2中的一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅