🔥 今日值得一读 DeltaWAM让机器人操作成功率飙至85.4%,训练省24%算力,推理延迟降36%!
DeltaWAM: Delta World Action Models for Bimanual Manipulation
arXiv CV (cs.CV) 🔥 重点 #机器人操作#世界模型#动作生成 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
只预测画面变化而非整帧,加速机器人动作生成,可用于双臂操作策略训练与视频生成先验迁移。

📖 AI 总结

本文提出 DeltaWAM,一种面向双臂操作的“增量世界动作模型”。针对现有世界动作模型在训练中反复预测大量未变化画面、将动作相关动态与无关外观变化耦合,以及推理时需用重型视频专家处理完整观测而导致动作生成受限的问题,作者设计了密集锚点、稀疏增量与动作三路联合预测框架,并给出三种在表征与计算共享方式上不同的架构;同时提出流式增量记忆(SDM),用紧凑的观测增量更新缓存的锚点上下文,减少重型视频专家的计算开销。在 RoboTwin 基准上,结合 SDM 的 DeltaWAM 将平均成功率从 Fast-WAM 的 81.3% 提升至 85.4%(干净环境),在视觉随机化下从 75.8% 提升至 83.9%;三种架构降低训练 FLOPs 17.78% 至 23.77%,SDM 将单步推理延迟和 FLOPs 分别降低 36.57% 和 31.55%。真实世界评估中,该方法在所比较策略里取得最高总体成功率和归一化进度,表明其在精度与效率上均具优势。

🔑 关键词速览

World-Action Models (WAMs)世界-动作模型,一类将预训练视频生成器的视觉与运动先验迁移到机器人控制的模型,通过联合建模视觉动态与动作来生成动作。
DeltaWAM本文提出的模型,通过稠密锚点、稀疏增量与动作流联合预测视觉增量与动作,以减少对不变内容的重复建模。
Streaming Delta Memory (SDM)流式增量记忆,一种用紧凑的观测增量更新缓存锚点上下文的机制,可减少沉重的视频专家处理并降低推理延迟。
RoboTwin一个用于双臂机器人操作的仿真基准平台,本文在该平台上评估 DeltaWAM 的成功率与视觉随机化鲁棒性。
Bimanual Manipulation双臂操作,指机器人使用两条机械臂协同完成抓取、装配等操作任务,是本文的应用场景。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅