OpenAI 发布的 GPT-6 Astra 在 ulam.ai 的 ErdosBench 数学基准测试中排名第一,该测试涵盖 226 道受著名埃尔德什问题启发的开放数学难题。Astra 得分 3.23,解出 106 道题,其中 43 道完全解决,另有 27 道被证伪,整体较前代模型 Sol 提升约 5% 至 10%。值得注意的是,OpenAI 首席科学家 Jakub Pachocki 明确表示,公司并未将数学研究作为优先优化方向,而是把资源集中于递归自我改进和自动化对齐研究。这意味着当前最强的数学 AI 模型并非专项优化的成果,而是其他优先目标的副产品。这一现象揭示了 AI 发展前沿中优化取舍的现实:在数学领域表现突出的模型未必在其他领域同样领先,也反映出当前“AGI”进程的实际状态与外界预期之间仍存在差距。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅