本文报道了AI科研评价领域的一项重大突破:由中国企业深度原理联合微软研究院、斯坦福大学等全球顶尖机构发布的论文《Measuring AI Scientists: From Exams to Discovery》,首次为AI真实科研能力提出了系统化评价范式。文章指出,传统HLE等闭卷考试式评测仅关注最终答案,无法检验AI在实际科研中的过程性能力,如反思异常数据、执行可验证实验等。新体系以“发现回合”为核心,全程记录AI在假设生成、方案执行、结果解读各环节的决策轨迹,并强调失败数据在训练和评估中的价值。深度原理的MIRA平台作为产业样本,已在化学、能源、药物发现等基准测试中取得双榜第一,且成本最优。这一标准的确立,标志着AI4S行业从比拼知识储备转向验证真实科研产出能力,为AI驱动科学发现的产业化落地提供了关键基础设施。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅