本文提出EPOCH,一种以证据治理为核心的AI研究智能体架构,旨在解决现有系统在程序、数学构造与证明搜索中,仅优化评估器反馈而缺乏对反馈解释、质疑与复用机制的问题。EPOCH通过显式任务契约、类型化记忆、主动证伪、准入检查与独立重放构建发现闭环,使候选方案依据其所支持主张的强度与范围接受评估,避免将基准提升、有限证书与定理级结论混为一谈。实验显示,EPOCH在AlgoTune上取得最优综合表现,平均归一化得分0.65,显著高于最强基线的0.53;在内部Math14套件上平均得分0.57,并在官方测试重放下表现良好,在AgentHPO描述性综合指标上领先。在十个发现任务中,EPOCH产出可执行构造改进、算法优化、反例及有证明支持的结果,表明证据治理是迈向更可信科学发现的关键一步。
| EPOCH | 一种证据治理的发现架构,通过任务契约、类型化记忆、主动证伪等机制确保候选方案评估的可靠性。 |
| 证据治理 | 对评估反馈进行解释、质疑和重用的管理机制,旨在防止脆弱候选被误认为发现。 |
| 主动证伪 | 主动寻找反例或证据来挑战候选方案,以检验其稳健性和有效性的方法。 |
| 类型化记忆 | 一种结构化存储机制,用于记录和管理不同类型的信息(如任务契约、证据等),以支持发现循环。 |
| AlgoTune | 一个用于评估算法搜索和优化性能的基准测试平台。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅