驾驶语义准确率飙至94%!新框架让视觉语言模型推理可验证
Grounding Vision-Language Models in Driving Semantics: A Multi-Dataset Predicate Framework for Explainable Reasoning
arXiv LG (cs.LG) 重要 #视觉语言模型#自动驾驶#可解释性#谓词框架 🕐 今天 12:00

📖 AI 总结

本文提出一种确定性的多数据集谓词框架,用于从可测量的几何、运动学、时序、地图与交通控制证据中推导驾驶场景语义,以解决视觉语言模型输出中语义关系难以核验的问题。该框架在nuPlan与nuScenes上保持谓词定义一致,仅通过数据集专属接口获取场景信息,并统一物化为谓词知识图谱。在每数据集200个场景的人工标注验证中,宏观F1分别达0.94与0.93,跨数据集平均差异仅0.02。基于冻结的LLaVA-OneVision-7B模型在九个NuPlanQA子任务上评估,谓词接地在七个子任务中取得最高准确率,如交通灯从53.2%提升至71.5%、情境评估从76.2%提升至86.1%、动作推荐从82.9%提升至89.0%;天气/光照因无对应谓词基本持平。结果表明,确定性谓词可提供一致且可追溯的语义表示,并在预言机接地条件下降低推理任务对视觉输入的依赖。

🔑 关键词速览

谓词框架一种从可测量的几何、运动学等证据中推导驾驶场景语义的确定性方法。
谓词知识图谱将谓词及其关系以图结构存储的知识库,用于统一表示驾驶场景语义。
NuPlanQA一个用于评估驾驶场景理解能力的问答基准数据集,包含多个子任务。
LLaVA-OneVision-7B一个冻结的视觉语言模型,用于评估谓词知识图谱在问答任务中的效果。
宏F1分数一种综合评价指标,计算每个类别的F1分数后取平均,用于衡量谓词关系识别的准确性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅