自动驾驶翻车现场:AI能看见事故,却说不清谁负责!
CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios
arXiv CV (cs.CV) 重要 #因果推理#自动驾驶#视频数据集 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
构建细粒度事故因果推理视频数据集,支持责任判定与规则违反分析,弥补自动驾驶高层推理能力缺失。

📖 AI 总结

该研究提出了CAViAR,一个用于真实场景下细粒度事故因果推理的视频数据集,包含2249段来自CarCrashDataset和Nexar的人工标注行车记录仪事故视频。每段视频标注了环境条件、事故类型、因果解释、明显责任方、受影响方及违反规则类别等结构化信息。研究团队对Cosmos-Reason2、Qwen3-VL和InternVL3等先进视觉语言模型进行了基准测试,结果显示:在考虑类别不平衡后,模型对光照条件的感知近乎解决,但在天气和道路状况识别上仅达到或低于多数类基线水平;所有模型在事故类型判断和责任推理任务上表现显著下降。该研究揭示了当前视觉语言模型存在“感知-推理鸿沟”——模型能识别显著场景上下文,却无法可靠地将可见的代理行为映射到规则相关的责任类别上,这一发现对安全关键的自动驾驶场景具有重要意义。

🔑 关键词速览

CAViAR因果事故视频与事件分析库,一个用于细粒度事故推理的因果视频数据集。
Vision-Language Models (VLMs)视觉语言模型,能够同时处理图像和文本信息,用于多模态理解任务。
At-Fault Agent责任方,指在事故中负有主要责任的代理(如车辆或行人)。
Perception-Reasoning Gap感知-推理差距,指模型能感知场景但无法进行高级因果推理的现象。
Dashcam Benchmark行车记录仪基准数据集,用于评估自动驾驶相关模型在真实驾驶场景中的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅