🔥 今日值得一读 AI破解千禧难题却栽了!论文复现率仅13.98%
ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?
量子位 🔥 重点 大模型论文方法评测基准 🕐 今天 17:28

📖 AI 总结

OpenAI近期宣称其模型在数学领域取得突破,但UniPat AI发布的PaperBenchX测评显示,面对93个真实论文复现任务,表现最强的GPT-6 Astra完整复现率仅为13.98%。该基准覆盖电磁、光子、化学、材料、生物、机器人等12个方向,包含3168条专家校验评分项,是首个多学科端到端论文复现评测。结果显示,模型在建模和执行阶段得分约六成,但验证阶段仅42.8%,且更多交互轮数并不带来更高分数,前期建模决策错误会导致后续计算全部失效。这一测评首次量化了当前AI与通用AI科学家之间的差距,也呼应了25位菲尔兹奖得主联名信中对“以解题为基准”的质疑,指出可靠复现才是衡量AI科研能力更基础的标准。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅