AI导师用5.8万条评审经验评估科研想法,与人类判断一致性最高提升29.7%!
DeepInstructor: An Agentic AI Instructor for Experience-Driven Idea Evaluation
arXiv CL (cs.CL) 重要 Agent论文方法科研自动化 🕐 今天 12:00

📖 AI 总结

随着大语言模型能够大规模生成研究想法,科研流程的瓶颈已从想法生成转向想法评估。现有评估方法主要依赖模型的参数化知识或无结构检索,缺乏人类导师那种基于经验的推理依据。为此,研究者提出DeepInstructor,一个将想法评估转化为对结构化学术经验进行推理的智能体框架。该框架基于58607条同行评审构建经验图谱,并利用基于ReAct的智能体检索针对具体评估维度的证据,从而实现可追溯的评估。研究还发布了DeepInstruct数据集,涵盖新颖性、重要性和可行性三个维度的受控成对比较。实验表明,DeepInstructor显著优于现有基线,与人类判断的一致性在Hit@1和Hit@2指标上分别提升24.4%和29.7%。该工作表明,科学想法评估可以建立在对结构化学术经验的显式推理之上。

🔑 关键词速览

DeepInstructor本文提出的智能体框架,将研究想法评估转化为对结构化学术经验的推理过程。
Experience Graph从大量同行评审中构建的结构化经验图,用于为评估提供可追溯的证据支持。
ReAct-based agent基于ReAct范式的智能体,通过交替推理与行动来检索维度特定的评估证据。
DeepInstruct本文构建的数据集,包含在新颖性、重要性和可行性维度上的受控成对比较。
Hit@1 / Hit@2评估指标,衡量模型评估结果与人类判断在排名前1或前2中的一致性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅