该论文提出Artemis,一种基于几何约束的多智能体驾驶世界模型,旨在解决现有视频世界模型在多智能体场景中跨视角一致性差、难以恢复视野外智能体以及无法建模非受控背景动态等问题。其核心方法是从多智能体观测中重建显式三维世界地图,以强制各智能体共享统一的三维状态;通过动作引导的几何注入模块渲染前景与背景控制图,并经GeoAdapter块注入扩散Transformer,从而区分非智能体的非受控动态并保持运动一致性。模型还利用渐进式视频推演中选取的关键帧持续更新三维世界地图。作者构建了基于CARLA模拟器的新数据集MA-CARLA,实验表明该方法在视觉保真度和跨视角一致性上均优于现有方法,并支持二维视频与三维点图同步推演,可扩展至两个以上智能体及多相机场景。
| Artemis | 本文提出的基于几何的多智能体驾驶世界模型,通过显式3D世界地图和记忆共享实现高跨视角一致性。 |
| GeoAdapter | 一种设计的适配器模块,用于将几何控制图注入扩散变换器,并区分不受控的非智能体动力学。 |
| MA-CARLA | 从CARLA模拟器采样的新数据集,用于捕捉多智能体复杂动态模式。 |
| 扩散变换器 | 一种结合扩散模型和Transformer架构的生成模型,用于视频世界模型中的高质量生成。 |
| 跨视角一致性 | 多视角生成中不同视角之间保持几何和外观一致的能力,是评价多智能体世界模型的重要指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅