该研究探讨了模型后训练与测试时推理设计如何影响高难度奥数题的自然语言证明生成。团队以 Nemotron 3 Ultra 为基础,通过监督微调和强化学习训练出两个专家检查点,并系统评估了检查点选择、验证与精炼策略。据此提出一套完全基于自然语言、不依赖形式化证明器、外部工具或联网的开放模型测试时计算流程:由通用模型与两个后训练专家模型共同驱动迭代搜索,生成、验证并精炼候选证明,再由独立的高算力阶段筛选最终答案。该系统在 IMO 2026 中获得 42 分中的 30 分,达到金牌线。作者同时开源了两个后训练检查点、训练数据、训练与推理代码、提交解答,以及包含 200 道全新奥数级题目的 Nemotron-IMO-Bench 基准。
| Nemotron 3 Ultra | 一个大型基础语言模型,作为本研究中进行后训练和推理的起点。 |
| 后训练 | 在预训练模型基础上,通过监督微调或强化学习进一步调整模型以适应特定任务的过程。 |
| 测试时计算 | 在推理阶段分配额外计算资源(如迭代搜索、验证和精炼)以提升模型输出质量的方法。 |
| IMO | 国际数学奥林匹克竞赛,面向高中生的世界顶级数学竞赛,金牌代表最高荣誉之一。 |
| Nemotron-IMO-Bench | 本文发布的一个包含200道新颖奥林匹克级别数学问题的新基准数据集,用于评估模型能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅