现有面向自主AI科学家的评测基准大多只考察最终产出,如生成的代码、假设或论文,却丢弃了获得这些结果所依赖的推理过程,导致无法审计科学方法、诊断失败模式,也难以区分系统性推理与侥幸猜测。为此,作者提出OpenDiscoveryTrace,一个包含558条完整AI科学智能体轨迹的公开数据集,覆盖药物发现、材料科学、基因组学和文献分析等124项任务,每条轨迹按每步9个字段记录思维、工具调用、观察、错误、修正触发和自我置信度。数据集涵盖七种模型,其中三种前沿模型各124条轨迹,四种开放权重模型各30条,另有60条实时检索变体。对363条轨迹的初步分析显示,过程轨迹能揭示仅看输出无法发现的行为差异:三种前沿模型成功率相近(84%至89%),但Claude Opus 4.6的每轨迹错误数达GPT-5.4的30倍(2.5对0.08),且错误类型分布明显不同。该工作为过程级评测、科学智能体审计和AI治理提供了公开资源与基准任务。
| OpenDiscoveryTrace | 本文提出的公开数据集,包含558条完整AI科学智能体轨迹,用于记录模型推理过程而非仅最终输出。 |
| 过程追踪(Process Traces) | 记录AI智能体每一步的思考、工具调用、观察、错误等结构化信息,以审计科学方法论和诊断失败模式。 |
| AI科学家(AI Scientist) | 指能够自主执行科学任务(如药物发现、材料科学等)的AI智能体,其工作流程包括推理、工具使用和输出生成。 |
| Cliff's δ | 一种非参数效应量度量,用于量化两组数据分布差异的大小,值越接近1表示差异越显著。 |
| 工具误用(Tool Misuse) | 智能体在执行任务时错误或不恰当地使用外部工具(如API、计算器)的行为,是过程追踪中识别的一种错误类型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅