在两项由Andon Labs设计的智能体基准测试中,OpenAI的GPT-6 Astra显著超越此前的顶尖模型Claude Fable 5.1。在模拟经营自动售货机一年的Vending-Bench测试中,Astra六次运行的平均最终余额达15515美元,接近Fable 5.1(5422美元)的三倍,且其最差成绩仍高于对方最佳成绩;差异主要体现在采购谈判上,Astra出价更稳定、更善于应对供应商倒闭等风险。在Drone-Bench测试中,Astra成为首个在全部五个子任务上均超过人机协作基线的模型,包括编写让无人机自主寻找并跟踪特定目标的代码,但其成功率仍不稳定。这一结果表明AI智能体在长周期自主决策和物理系统编程方面取得明显进展,同时可靠性问题依然存在。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅