Figure AI 发布 Helix 2.5,宣称在机器人领域首次验证了类似大语言模型的 scaling law。该公司将机器人送入旧金山湾区 30 套陌生住宅,在未针对具体房屋和物品进行训练或微调的情况下,测试整理客厅、折叠毛巾和铺床三项任务,共完成 420 次测试,成功 237 次,整体成功率 56%,而未经过人类行为数据预训练的对照模型成功率仅约 9%。Figure AI 据此认为,来自人类行为数据集的预训练使机器人获得了跨住宅、跨物品的迁移能力,并展示了数据规模扩大与下游表现提升之间的关系。但同行对此提出质疑,认为接近一半的失败率恰恰说明其模仿学习系统尚不具备真正的泛化能力。这场争论的核心在于:56% 的成功率究竟是机器人泛化能力的起点,还是证明该技术路线仍难以走出实验室的反例。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅