一项名为StationeryBench的新机器人基准测试显示,OpenAI的GPT-6 Astra在空间推理上相较竞品出现明显跃升。测试让Astra与Ai2的MolmoAct2分别控制同一款双臂机器人,完成打开马克笔、倒出回形针、在两臂间传递直尺等五项桌面任务,共进行200次试验。结果显示,Astra完整完成任务7次,MolmoAct2为零;Astra的中位进度得分为46分(满分100),MolmoAct2仅12分。康奈尔大学兼谷歌DeepMind研究员Yoav Artzi称其为空间推理的“阶跃式变化”,并指出在尚未公开的REMAP基准上,Astra准确率已接近人类水平,但在其他场景中仍不及人类。他推测OpenAI使用了大量Blender等3D数据进行训练,这与Astra在三维任务上的突出表现相符。该进展对OpenAI长期布局消费级机器人具有重要意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅