本文提出 IdeaScientist,将科研创意生成拆解为“发现空白—创新—撰写报告”三个角色,并用强化学习分别训练各角色,使其能识别相关工作局限、从类比问题中汲取解决思路,并发展为完整研究提案。为支持跨领域洞察,作者构建了包含 277 万条拆解研究想法的 Svalbard Idea Vault 语料库,用于检索、训练和带时间控制的评估。评估限定只使用截止日期前的文献,并以 1.5 万篇人类后续论文衡量所提方向与真实研究趋势的吻合度。结果显示,在 Qwen3.6-27B 上,IdeaScientist 比最强开源自动科研基线高出 14.0%,提升主要来自新颖性;该 27B 开放模型甚至比搭载 Claude-4.8-Opus 和 GPT-5.4 的闭源方案高出最多 5.9%。
| IdeaScientist | 本文提出的多智能体系统,将科研构思拆解为空白发现、创新和报告撰写三个角色,并用强化学习分别训练。 |
| Research Ideation | 研究构思,指提出有前景且论证充分的研究方向或方案的过程,本文将其作为独立任务加以研究。 |
| Svalbard Idea Vault | 本文构建的大规模研究想法语料库,包含 277 万条分解后的想法,用于检索、训练和时间可控评估。 |
| Reinforcement Learning | 强化学习,一种通过奖励信号训练智能体策略的机器学习范式,本文用它分别训练构思流程中的各个角色。 |
| Temporally Controlled Evaluation | 时间可控评估,一种评估方法,限制模型只能访问截止日期前的文献,以公平检验其提出方向与后续人类研究的一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅