🔥 今日值得一读 13k真实机器人帧测16种模型,多数短标签才最强!
Pro-Bench: Prompt-Robust Open-Vocabulary Visual Grounding Across Real-World Heterogeneous Environments
arXiv CV (cs.CV) 🔥 重点 #视觉定位#开放词汇#评测基准#机器人 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做机器人视觉定位的开发者可用它测试模型在真实多变环境和自然语言查询下的鲁棒性。

📖 AI 总结

本文提出 Pro-Bench,一个面向开放词汇视觉定位的提示条件基准,旨在评估模型在真实异构环境中的鲁棒性。该基准汇集了来自地下、工业、室内、室外和城市等独立机器人领域的 1.3 万余帧 RGB 图像,包含 7.45 万条人工实例标注和 515 条目标查询,覆盖类别、属性、关系、可供性、状态、部分—整体、否定及组合语义等多种语义类型。研究在严格零样本设定下评测了 16 种开放词汇模型配置,测量不同 IoU 阈值下的定位精度、端到端推理延迟、提示引起的性能波动以及目标恢复一致性。结果显示,提示鲁棒性高度依赖模型架构:16 种配置中有 10 种在短类别标签下表现最佳,仅 1 种在自由形式查询下取得最高精度;此外,相近的总体 mAP 可能掩盖不同改写间目标恢复一致性的显著差异。该工作为系统评估并推动提示鲁棒的视觉定位提供了基准支持。

🔑 关键词速览

Open-vocabulary visual grounding开放词汇视觉定位,指模型根据自然语言查询定位图像中目标,无需预定义类别限制。
Pro-Bench一个用于异构真实环境中开放词汇视觉定位的提示条件基准测试平台。
Prompt-robustness提示鲁棒性,指模型在不同提示表述下保持性能稳定的能力。
Zero-shot inference零样本推理,模型在未见过的任务或类别上直接进行预测,无需额外训练。
mAP平均精度均值,一种评估目标检测或定位性能的常用指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅