随着大语言模型智能体逐步具备自主开展研究的能力,其产出的研究文档与配套代码、实验之间是否真正一致,成为亟待验证的问题。现有评审方式主要关注文本质量,难以识别硬编码指标、未实现的方法或缺乏支撑的实验结果等不一致现象。为此,作者提出自动化审计框架ReAgent,从研究文档中提取结构化科学主张,并据此指导代码仓库分析与证据收集:静态审计核查方法、实现与实验配置是否在仓库中一致体现,动态审计则实际执行相关实验并采集执行证据以评估实证结论。两者结合可发现单一视角下难以察觉的问题,例如复现了报告数值却偏离所声称方法的实验。审计证据与判定被整理为结构化的仓库级审计报告,实现证据可追溯。在人工构建的智能体生成文档—仓库配对基准上,ReAgent相较代表性静态与复现类基线能更有效识别报告发现与其支撑证据之间的不一致。
| ReAgent | 本文提出的自动化审计框架,用于核查智能体生成的研究文档与其代码仓库之间的一致性。 |
| 静态审计 | 通过分析仓库代码与配置,检查所声称的方法、实现和实验设置是否被一致地反映出来。 |
| 动态审计 | 通过实际执行相关实验并收集运行证据,来验证文档中报告的实证结果是否成立。 |
| 仓库级审计报告 | 将收集到的证据与审计决策组织成的结构化报告,支持证据的可追溯与透明审查。 |
| 智能体生成研究文档 | 由大型语言模型智能体自主产出的研究论文或报告,通常附带声称支撑其结论的代码与实验。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅