SPW-Nav是一种流式全景世界模型,能够理解语言运动指令,并从单张全景图实时生成一分钟的2K 360度视频。针对现有全景生成器只能沿预设轨迹生成、交互式世界模型仅支持透视视角低层动作的局限,该研究提出球面旋转解耦、姿态对齐条件化和多步记忆机制,使模型在长序列流式生成中保持平移输入有界,并支持指令动态切换。团队还构建了包含相机轨迹与验证指令的SPW-NavSet数据集。实验表明,在语言驱动下,SPW-Nav在相机跟随精度和视频质量上均优于已有全景生成器,可应用于交互式3D场景探索、虚拟现实和具身智能体训练等场景。
| SPW-Nav | 一种流式全景世界模型,能够根据语言指令实时生成全景视频。 |
| 全景视频生成 | 生成360度全景视频的技术,用于沉浸式体验和场景探索。 |
| 球面旋转解耦 | 将旋转操作精确应用于球面上的方法,确保全景图像旋转的准确性。 |
| 姿态对齐条件 | 一种条件机制,使平移输入在长视频流中保持有界,避免误差累积。 |
| SPW-NavSet | 一个包含全景视频、相机轨迹和验证指令的数据集,用于训练和评估导航模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅