该研究提出一种名为“动作强制”的方法,旨在解决可控世界模型训练中同步动作标注数据稀缺的问题。作者不再依赖昂贵的传感器标定或人工标注,而是直接从无标签视频中恢复出数据驱动的自我运动基,通过追踪帧间像素位移并利用主成分分析提取主导分量,获得有符号、可缩放且可组合的油门—偏航控制信号。为防止高容量视频扩散模型利用像素级监督走捷径,方法引入在线潜在评判器,在不回传梯度的情况下蒸馏冻结的解码器—追踪器—主成分分析教师。研究还批评了以视频生成指标评估世界模型的做法,并提出无参考评估方法,从可控性、合理性、凭空生成物体和几何完整性四个维度进行衡量。实验显示,多数基线能沿常见动作方向运动,却难以反向或保持静止,而该模型在反向动作不足训练数据百分之一的情况下仍学会反向、线性缩放响应并组合油门与转向,同时保持生成质量。
| 世界模型 (World Models) | 一种能够模拟环境动态并预测未来状态的生成模型,常用于基于模型的强化学习和机器人控制。 |
| 自我运动基 (Egomotion Basis) | 从视频中提取的、描述相机自身运动(如平移和旋转)的基本运动模式,用于生成控制信号。 |
| 主成分分析 (Principal Components Analysis, PCA) | 一种常用的降维方法,通过线性变换将数据投影到方差最大的几个主成分上,此处用于从像素位移中提取主要运动轴。 |
| 视频DiT (Video DiT) | 基于扩散Transformer的视频生成模型,具有高容量,能够生成高质量视频,但可能过度拟合像素级监督。 |
| 潜在评判器 (Latent Critic) | 在潜在空间中评估生成动作或状态质量的模型,用于指导训练而不直接反向传播通过教师模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅