这篇文章介绍了一项具身智能领域的新研究——由光象科技与清华大学李升波教授课题组联合发布的物理原生世界模型Phi-WM 1.0 ActEffect。其核心创新在于一反常规:世界模型仅在训练阶段发挥作用,通过预测机器人动作的后果来优化策略,训练完成后便从部署链路中退出,使机器人执行任务时无需实时展开未来推理。该方法在模仿学习基础上,让策略生成三版动作提案,由受控世界模型评估其后果并排序反馈,从而提升动作质量。实验结果显示,ActEffect在LIBERO基准上取得98.8%的平均成功率,在加入分布偏移的LIBERO-PLUS上达80.3%,在29维动作空间的RoboCasa-GR1上为67.5%,均优于对比方法。这项技术通过将世界模型限制在训练阶段,有效降低了工业部署中的推理时延和算力成本,为具身智能的实际应用提供了更具经济性的路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅