该研究提出了CAViAR,一个用于真实场景下细粒度事故因果推理的视频数据集,包含2249段来自CarCrashDataset和Nexar的人工标注行车记录仪事故视频。每段视频标注了环境条件、事故类型、因果解释、明显责任方、受影响方及违反规则类别等结构化信息。研究团队对Cosmos-Reason2、Qwen3-VL和InternVL3等先进视觉语言模型进行了基准测试,结果显示:在考虑类别不平衡后,模型对光照条件的感知近乎解决,但在天气和道路状况识别上仅达到或低于多数类基线水平;所有模型在事故类型判断和责任推理任务上表现显著下降。该研究揭示了当前视觉语言模型存在“感知-推理鸿沟”——模型能识别显著场景上下文,却无法可靠地将可见的代理行为映射到规则相关的责任类别上,这一发现对安全关键的自动驾驶场景具有重要意义。
| CAViAR | 因果事故视频与事件分析库,一个用于细粒度事故推理的因果视频数据集。 |
| Vision-Language Models (VLMs) | 视觉语言模型,能够同时处理图像和文本信息,用于多模态理解任务。 |
| At-Fault Agent | 责任方,指在事故中负有主要责任的代理(如车辆或行人)。 |
| Perception-Reasoning Gap | 感知-推理差距,指模型能感知场景但无法进行高级因果推理的现象。 |
| Dashcam Benchmark | 行车记录仪基准数据集,用于评估自动驾驶相关模型在真实驾驶场景中的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅