该研究针对视觉语言模型在自动驾驶中多以自车视角为主、忽视路侧观测的问题,提出了CoVLM-Bench——一个面向车路协同场景的问答与规划基准。该基准包含2196对车路配对帧、35136条场景问答标注,并提供三段式推理依据作为辅助监督,以及基于真实自车运动轨迹的未来轨迹目标,规划任务需预测三秒内的六个路点。标注过程结合模型辅助起草、记录计算与人工校验。基于此,作者提出统一基线CoVLM-Drive,直接利用配对视角同时完成协同问答与规划。实验表明,问答适配可提升答案准确率,CoVLM-Drive的最终位移误差低于对比的V2X规划器,且问答初始化与推理监督均能降低规划误差。该工作为协同场景理解与规划的视觉语言模型训练和比较提供了统一平台。
| CoVLM-Bench | 一个面向车路协同场景的基准数据集,用于联合评估协同驾驶问答与轨迹规划任务。 |
| CDQA | 协同驾驶问答,指基于车路配对场景回答与驾驶决策相关问题的任务。 |
| CP | 协同规划,指利用车路协同信息预测自车未来轨迹的任务。 |
| VLM | 视觉语言模型,一种能够同时处理视觉和文本信息的多模态大模型。 |
| FDE | 最终位移误差,衡量预测轨迹终点与真实终点之间距离的规划评价指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅