🔥 今日值得一读 AI研究智能体新突破:EPOCH证据治理架构让发现更可信,AlgoTune得分0.65碾压最强基线0.53!
EPOCH: Reliable Discovery through Evidence-Governed Search
arXiv AI (cs.AI) 🔥 重点 Agent论文方法安全对齐 🕐 10-07 12:00

📖 AI 总结

本文提出EPOCH,一种以证据治理为核心的AI研究智能体架构,旨在解决现有系统在程序、数学构造与证明搜索中,仅优化评估器反馈而缺乏对反馈解释、质疑与复用机制的问题。EPOCH通过显式任务契约、类型化记忆、主动证伪、准入检查与独立重放构建发现闭环,使候选方案依据其所支持主张的强度与范围接受评估,避免将基准提升、有限证书与定理级结论混为一谈。实验显示,EPOCH在AlgoTune上取得最优综合表现,平均归一化得分0.65,显著高于最强基线的0.53;在内部Math14套件上平均得分0.57,并在官方测试重放下表现良好,在AgentHPO描述性综合指标上领先。在十个发现任务中,EPOCH产出可执行构造改进、算法优化、反例及有证明支持的结果,表明证据治理是迈向更可信科学发现的关键一步。

🔑 关键词速览

EPOCH一种证据治理的发现架构,通过任务契约、类型化记忆、主动证伪等机制确保候选方案评估的可靠性。
证据治理对评估反馈进行解释、质疑和重用的管理机制,旨在防止脆弱候选被误认为发现。
主动证伪主动寻找反例或证据来挑战候选方案,以检验其稳健性和有效性的方法。
类型化记忆一种结构化存储机制,用于记录和管理不同类型的信息(如任务契约、证据等),以支持发现循环。
AlgoTune一个用于评估算法搜索和优化性能的基准测试平台。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅