World Labs 发布了名为 Atlas 的单一 AI 模型,能够从少量照片中生成、重建和模拟 3D 世界。该模型由李飞飞联合创办的公司开发,旨在实现“空间智能”,即让 AI 像人类一样理解三维空间。Atlas 是一个从头训练的“全能模型”,整合了文本、图像、视频和 3D 数据,并将每个输入锚定到三维空间中的特定位置,这种“空间上下文”机制使其区别于传统的语言或视频模型。关键能力包括:支持相机控制的生成,可输出长达一分钟的 1440p 视频;以及从一到几十张图像进行空间重建,无需特殊采集设备。据称,Atlas 在特定任务上超越了专业模型,例如仅用两三张图像即可实现高保真重建,甚至能处理上百个输入。这一进展可能使许多现有专用模型变得多余,标志着 AI 理解三维世界方式的重大转变。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅