本文提出 Valerant,一个无需训练的框架,可将预训练的动作条件世界模型转化为世界动作模型(WAM),用于自动探索并构建三维游戏地图。研究指出,现有面向游戏的方法多依赖外部策略与奖励函数,且主要在二维视觉空间运作,无法生成持久的三维几何结构;而三维游戏缺乏像自动驾驶和机器人领域那样独立于模型存在的物理环境,虚拟世界必须由模型自身实例化。Valerant 通过将预测性视觉推演与基于 SLAM 的空间重建及探索驱动的动作选择相结合,从单张图像出发,逐步生成持久且可导航的三维游戏地图。该工作把基于 WAM 的交互从二维视觉模拟拓展至三维空间构建,为减少三维游戏地图制作中的人工投入提供了新思路。
| World Action Models (WAMs) | 世界动作模型,一种将预测性世界建模与动作生成相结合的AI模型,使智能体能够利用预期的未来状态指导行为。 |
| Action-Conditioned World Model | 动作条件世界模型,一种根据给定动作预测未来视觉观察的模型,常用于模拟环境动态。 |
| SLAM | 同步定位与建图,一种使智能体在未知环境中同时估计自身位置并构建环境地图的技术。 |
| Embodied AI | 具身AI,指在物理或虚拟环境中具有身体并能够通过感知和行动与环境交互的人工智能。 |
| 3D Game Map | 三维游戏地图,一种具有显式几何结构、支持角色移动和交互的持久性虚拟空间。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅