🔥 今日值得一读 无标注视频直接训练可控世界模型,无需动作标签!
Action Forcing: Training World Models on Unsupervised Video by Recovering Underlying Egomotion Bases
arXiv CV (cs.CV) 🔥 重点 #世界模型#自监督学习#视频生成 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可将普通无标注视频转为带控制信号的训练数据,帮助开发者低成本训练可控视频世界模型。

📖 AI 总结

该研究提出一种名为“动作强制”的方法,旨在解决可控世界模型训练中同步动作标注数据稀缺的问题。作者不再依赖昂贵的传感器标定或人工标注,而是直接从无标签视频中恢复出数据驱动的自我运动基,通过追踪帧间像素位移并利用主成分分析提取主导分量,获得有符号、可缩放且可组合的油门—偏航控制信号。为防止高容量视频扩散模型利用像素级监督走捷径,方法引入在线潜在评判器,在不回传梯度的情况下蒸馏冻结的解码器—追踪器—主成分分析教师。研究还批评了以视频生成指标评估世界模型的做法,并提出无参考评估方法,从可控性、合理性、凭空生成物体和几何完整性四个维度进行衡量。实验显示,多数基线能沿常见动作方向运动,却难以反向或保持静止,而该模型在反向动作不足训练数据百分之一的情况下仍学会反向、线性缩放响应并组合油门与转向,同时保持生成质量。

🔑 关键词速览

世界模型 (World Models)一种能够模拟环境动态并预测未来状态的生成模型,常用于基于模型的强化学习和机器人控制。
自我运动基 (Egomotion Basis)从视频中提取的、描述相机自身运动(如平移和旋转)的基本运动模式,用于生成控制信号。
主成分分析 (Principal Components Analysis, PCA)一种常用的降维方法,通过线性变换将数据投影到方差最大的几个主成分上,此处用于从像素位移中提取主要运动轴。
视频DiT (Video DiT)基于扩散Transformer的视频生成模型,具有高容量,能够生成高质量视频,但可能过度拟合像素级监督。
潜在评判器 (Latent Critic)在潜在空间中评估生成动作或状态质量的模型,用于指导训练而不直接反向传播通过教师模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅