🔥 今日值得一读 VANTAGE-Bench:17个模型在固定摄像头下暴降24分!
VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models
arXiv CV (cs.CV) 🔥 重点 #评测基准#视觉语言模型#物理AI 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
为固定摄像头监控类应用提供VLM评测基准,帮助开发者评估部署前的模型短板。

📖 AI 总结

这篇论文提出 VANTAGE-Bench,一个针对“基础设施 AI 差距”的评测基准,旨在衡量视觉语言模型在固定摄像头场景下的能力短板。该基准覆盖物流、交通和智能空间三大领域,统一图像与视频评测,涵盖语义、空间、时间及时空四类能力,并设计了八种任务形式,包括密集描述和时空定位,同时引入单目标跟踪的单次轨迹协议。评测基于 3346 项媒体素材,包含 3342 条视频任务标注、4281 条图像定位标注和 27404 个检测框。对 17 个模型的零样本评测显示,模型的能力缺口是集中而非普遍的:事件验证、指代表达和时间定位在各规模模型上均落后约 9 至 24 分,而视频问答与 VideoMME 差距在 5.3 分以内,二维空间指向相对 BLINK 无明显短板。时间维度绝对表现最弱,无系统在时间定位上超过 55.7 mIoU,密集视频描述最高仅 37.3 SODA_c。跟踪任务中,前沿模型在短时程内接近专用跟踪器,但随视界延长差距拉大。开源权重模型在二维目标定位上反而领先,表明该差距既非规模也非专有访问所能解释。

🔑 关键词速览

VANTAGE-Bench一个用于评估视觉语言模型在基础设施AI场景下性能的基准测试。
Infrastructure AI依赖固定摄像头进行安全监控、操作日志等开环洞察的物理AI类别。
Vision-Language Models (VLMs)能够同时处理视觉和语言信息的人工智能模型。
Single Object Tracking在视频序列中持续跟踪单个指定目标的任务。
mIoU平均交并比,一种衡量图像分割或定位任务精度的指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅