🔥 今日值得一读 GPT-6 Astra效率首超人类!ARC-AGI-3测试惊呆专家,AGI预测提前了?
Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI-3 pulls Chollet’s AGI forecast forward
The Decoder 🔥 重点 大模型AGI基准测试 🕐 09-04 19:07

📖 AI 总结

关于GPT-6 Astra的基准测试结果出现明显分歧:Epoch AI综合50多项测试后将其评为第一(169分),而Artificial Analysis则认为其与上一代持平(61分),落后于Claude Fable 5.1。最引人注目的是ARC-AGI-3测试中,Astra首次以62.7%的成绩超越人类平均效率,而前代Sol仅得7.8%。ARC Prize负责人François Chollet因此将AGI预测时间提前,称进展比预期快一倍。该模型虽定价为前代2.5倍,但计算步骤仅需三分之一,在编码任务上成本低于Anthropic一半。此外,Astra是唯一在FrontierMath Erdős测试中解决两道开放数学问题的模型,幻觉率从92%降至51%,但在部分推理任务上有所退步。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅