李飞飞团队World Labs发布全球首个多模态世界模型Atlas,该模型以多模态自回归扩散Transformer为基础架构,能同时处理文本、图像、视频、3D深度图等多种数据类型。Atlas的核心能力包括:仅凭一张图片即可生成像素级相机控制的1分钟1440p视频;基于稀疏输入重建3D场景,效果超越专业3D重建模型;支持时空模拟,可转换视频视角并生成逼真RGB和深度数据,为机器人训练提供Real-to-Sim工作流。在定量评估中,Atlas在相机控制生成和3D重建任务上均优于现有SOTA模型,且能力随规模扩大持续提升。该模型被视为具身智能领域的关键突破,打通了从真实场景到模拟环境的路径,为视觉特效和机器人训练等应用开辟了新可能。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅