文章介绍了一种名为“Code-as-World”的新范式,由MirroS团队提出,旨在将真实视频转化为可执行的MuJoCo物理程序。其核心观点是:像素只是物理场景的证据,而非本体,视频模型虽能预测画面,却无法表征质量、接触和重力等物理机制。该方法将场景表示为可执行代码(场景三元组:组成、演化、外观),通过一个最多五轮的智能体循环从视频中恢复程序,并可用源视频验证。这些经过验证的世界成为带有精确物理标签的训练数据,弥补了真实视频的不足。基于此训练的Code-as-World-VL-9B模型在QuantiPhy验证集上取得55.4 MRA分数,超越Gemini-3.1 Flash,并显著领先最强开源基线约15分。项目已以Apache 2.0协议开源,提供4B和9B两个检查点,具备实际部署可行性。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅