ZimaBlue提出了一种可扩展的框架,旨在通过大规模视频预训练构建通用世界动作模型,以解决机器人操作中动作标注数据稀缺且多样性受限的问题。该框架采用三阶段训练流程:先在人类和机器人第一视角视频上进行因果嵌入预训练,再通过统一动作表示在异构机器人轨迹中建立视觉动态与动作的关联,最后针对目标机器人进行专门化微调。为满足实时控制需求,ZimaBlue设计了异步慢-快双系统架构,其中高容量慢世界模型提供通用时空表征,轻量快分支在NVIDIA RTX 4090上实现30赫兹动作预测。在真实机器人零样本评估中,将训练数据从仅目标机器人数据扩展至超过12万小时的嵌入视频,成功率从36.1%提升至77.8%。此外,该模型在多个基准测试中表现优异,尤其在未见任务上增益显著,展示了视频预训练在提升机器人泛化能力方面的巨大潜力。
| World Action Models (WAMs) | 世界动作模型,一种从视频中学习环境动态并生成动作的生成式模型,用于机器人控制。 |
| Egocentric videos | 第一人称视频,从执行者视角拍摄,捕捉物体交互和操作细节,提供丰富的具身经验。 |
| Causal embodied video pre-training | 因果具身视频预训练,一种在视频数据上训练模型以理解时间因果关系的预训练方法。 |
| Slow-Fast dual-system architecture | 慢-快双系统架构,结合高容量慢速模型和轻量快速分支,平衡泛化能力和实时推理速度。 |
| Zero-shot evaluation | 零样本评估,在未见过的任务或环境中测试模型的泛化能力,不进行额外微调。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅