千张图7400标注,七种VLM在夏威夷海岸谁能扛住18类识别?
Evaluation of Vision-Language Models Across Diverse Coastal Environments
arXiv CV (cs.CV) 重要 #视觉语言模型#评测基准#机器人感知#海岸环境 🕐 09-11 12:00

📖 AI 总结

这篇论文评估了视觉语言模型(VLM)在海岸环境中的表现,该场景此前研究较少。作者构建了一个密集标注的海岸数据集,包含夏威夷瓦胡岛三个区域、七次任务采集的1000多张图像,涵盖18个语义类别和7400多个标注实例,并通过文本到掩码、掩码到掩码、掩码到文本三类实验对七种主流VLM进行了测试。结果显示,大范围景观类别的识别准确率普遍高于常规物体和海岸类别,海岸概念最具挑战性;但将常规类别在海岸与陆地数据集间对比后,并未发现仅由环境背景导致的性能差异。掩码到掩码匹配在两类场景中表现相近,而替换文本标签可显著提升部分海岸概念的识别效果。研究表明,海岸类别性能偏低主要受分割质量和语言表征方式影响,而非环境本身。

🔑 关键词速览

Vision-language models (VLMs)视觉语言模型,一类能同时处理图像和文本、将视觉观察与自然语言概念关联的模型。
Coastal environments沿海环境,指海岸线附近的自然场景,包含沙滩、礁石、海水等复杂视觉元素。
Text-to-mask / Mask-to-mask / Mask-to-text alignment文本到掩码、掩码到掩码、掩码到文本对齐,三种评估视觉语言模型跨模态匹配能力的实验范式。
Semantic classes语义类别,数据集中对图像区域进行标注的类别标签,如“沙滩”“岩石”等。
Segmentation分割,将图像划分为具有语义意义的区域或像素级掩码的过程。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅