关于GPT-6 Astra的基准测试结果出现明显分歧:Epoch AI综合50多项测试后将其评为第一(169分),而Artificial Analysis则认为其与上一代持平(61分),落后于Claude Fable 5.1。最引人注目的是ARC-AGI-3测试中,Astra首次以62.7%的成绩超越人类平均效率,而前代Sol仅得7.8%。ARC Prize负责人François Chollet因此将AGI预测时间提前,称进展比预期快一倍。该模型虽定价为前代2.5倍,但计算步骤仅需三分之一,在编码任务上成本低于Anthropic一半。此外,Astra是唯一在FrontierMath Erdős测试中解决两道开放数学问题的模型,幻觉率从92%降至51%,但在部分推理任务上有所退步。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅