该研究提出DriveHierarchy,一个面向视觉语言模型(VLM)自动驾驶能力的层级化评测基准,旨在解决现有基准难以解释能力组织结构及其相互关系的局限。该框架将VLM自动驾驶能力划分为感知定位、上下文记忆、心智推理与闭环执行四个层级,并整合多个开源数据集构建了包含76,798个问答对、覆盖84,279帧的统一开环基准,同时基于真实路网搭建闭环仿真平台,筛选出100个驾驶场景用于具身评测。对15个VLM的实验表明,该基准能够捕捉结构化且非冗余的能力差异,建立开环理解与闭环驾驶之间的联系,为模型诊断和基准引导的优化提供实用依据,从而形成评估与改进VLM自动驾驶系统的统一框架。
| VLM(视觉语言模型) | 一种能够同时处理视觉和文本信息的多模态大模型,常用于自动驾驶中的场景理解与决策。 |
| DriveHierarchy | 本文提出的分层基准,将基于 VLM 的自动驾驶能力划分为感知定位、上下文记忆、心智推理和闭环执行四个层级。 |
| 开环理解 | 指模型在不与环境交互的情况下,对驾驶场景进行感知、理解和推理的能力评估。 |
| 闭环执行 | 指模型在仿真环境中根据实时反馈进行驾驶决策和动作执行的能力评估。 |
| 具身评估 | 在交互式仿真环境中对模型进行身体化、动态的驾驶能力测试,强调行动与环境的实时交互。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅