🔥 今日值得一读 通义千问出手!一个模型搞定3D感知+规划,自动驾驶VLM新标杆
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
arXiv CV (cs.CV) 🔥 重点 #自动驾驶#多模态#基础模型 🕐 09-02 12:00
👨‍💼 主理人解读 · 为什么值得关注
为自动驾驶提供统一的多模态基础模型,开发者可基于其进行3D感知和规划任务的集成开发。

📖 AI 总结

Qwen-Drive-1.0 是面向自动驾驶的视觉语言基础模型,在保留预训练视觉语言模型架构的基础上,将 3D 感知、视觉问答与运动规划整合进统一框架。模型引入外部鸟瞰图感知头,联合完成 3D 目标检测、语义占用预测和 BEV 地图分割,既探测共享表征中的 3D 信息,也提供可检查的 3D 场景结构接口。规划专家模块基于共享表征生成未来自车轨迹。训练采用分阶段策略,将驾驶监督与通用视觉语言数据结合,在获取驾驶专项能力的同时保持广泛的视觉理解与指令跟随能力。实验表明,模型在 3D 感知和驾驶场景理解上表现强劲,同时基本保留通用视觉语言能力;在开环、伪闭环和闭环等多种评估设置下,运动规划性能均具较强竞争力。

🔑 关键词速览

Vision-Language Foundation Model视觉-语言基础模型,一种结合视觉和语言处理的大型预训练模型,用于多模态理解任务。
Bird's-Eye-View (BEV)鸟瞰图视角,一种从上方俯视场景的表示方法,常用于自动驾驶中的3D感知。
Semantic Occupancy Prediction语义占用预测,预测3D空间中每个体素是否被占用及其语义类别,用于环境理解。
Motion Planning运动规划,生成车辆未来行驶轨迹的过程,是自动驾驶的核心决策模块。
Closed-Loop Evaluation闭环评估,在模拟或真实环境中测试系统与环境的交互,相比开环评估更接近实际驾驶条件。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅