这篇论文提出 VANTAGE-Bench,一个针对“基础设施 AI 差距”的评测基准,旨在衡量视觉语言模型在固定摄像头场景下的能力短板。该基准覆盖物流、交通和智能空间三大领域,统一图像与视频评测,涵盖语义、空间、时间及时空四类能力,并设计了八种任务形式,包括密集描述和时空定位,同时引入单目标跟踪的单次轨迹协议。评测基于 3346 项媒体素材,包含 3342 条视频任务标注、4281 条图像定位标注和 27404 个检测框。对 17 个模型的零样本评测显示,模型的能力缺口是集中而非普遍的:事件验证、指代表达和时间定位在各规模模型上均落后约 9 至 24 分,而视频问答与 VideoMME 差距在 5.3 分以内,二维空间指向相对 BLINK 无明显短板。时间维度绝对表现最弱,无系统在时间定位上超过 55.7 mIoU,密集视频描述最高仅 37.3 SODA_c。跟踪任务中,前沿模型在短时程内接近专用跟踪器,但随视界延长差距拉大。开源权重模型在二维目标定位上反而领先,表明该差距既非规模也非专有访问所能解释。
| VANTAGE-Bench | 一个用于评估视觉语言模型在基础设施AI场景下性能的基准测试。 |
| Infrastructure AI | 依赖固定摄像头进行安全监控、操作日志等开环洞察的物理AI类别。 |
| Vision-Language Models (VLMs) | 能够同时处理视觉和语言信息的人工智能模型。 |
| Single Object Tracking | 在视频序列中持续跟踪单个指定目标的任务。 |
| mIoU | 平均交并比,一种衡量图像分割或定位任务精度的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅