Artificial Analysis发布了其智能指数4.2版本,以回应外界对其基准测试未能准确反映GPT-6 Astra实际进展的批评。此前,包括OpenAI自身在内的多项评估显示Astra大幅领先,但Artificial Analysis却将其评分与前任模型持平。更新后的指数中,GPT-6 Astra较前任提升4分,但仍落后于Anthropic的Claude Fable 5.1,位列第二,Meta排名第三。该版本新增了AA-Briefcase和GDP.pdf两个基准测试,并因GPQA-Diamond已被模型解决而移除,同时将私有测试数据权重提升至40%以防止作弊。此外,修复了多项评分错误并调整了评分系统。Artificial Analysis表示,因排行榜头部变动过快,不得不进行此次临时更新,而筹备八个月的5.0版本将分阶段推出。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅