Qwen-Drive-1.0 是面向自动驾驶的视觉语言基础模型,在保留预训练视觉语言模型架构的基础上,将 3D 感知、视觉问答与运动规划整合进统一框架。模型引入外部鸟瞰图感知头,联合完成 3D 目标检测、语义占用预测和 BEV 地图分割,既探测共享表征中的 3D 信息,也提供可检查的 3D 场景结构接口。规划专家模块基于共享表征生成未来自车轨迹。训练采用分阶段策略,将驾驶监督与通用视觉语言数据结合,在获取驾驶专项能力的同时保持广泛的视觉理解与指令跟随能力。实验表明,模型在 3D 感知和驾驶场景理解上表现强劲,同时基本保留通用视觉语言能力;在开环、伪闭环和闭环等多种评估设置下,运动规划性能均具较强竞争力。
| Vision-Language Foundation Model | 视觉-语言基础模型,一种结合视觉和语言处理的大型预训练模型,用于多模态理解任务。 |
| Bird's-Eye-View (BEV) | 鸟瞰图视角,一种从上方俯视场景的表示方法,常用于自动驾驶中的3D感知。 |
| Semantic Occupancy Prediction | 语义占用预测,预测3D空间中每个体素是否被占用及其语义类别,用于环境理解。 |
| Motion Planning | 运动规划,生成车辆未来行驶轨迹的过程,是自动驾驶的核心决策模块。 |
| Closed-Loop Evaluation | 闭环评估,在模拟或真实环境中测试系统与环境的交互,相比开环评估更接近实际驾驶条件。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅