这篇论文评估了视觉语言模型(VLM)在海岸环境中的表现,该场景此前研究较少。作者构建了一个密集标注的海岸数据集,包含夏威夷瓦胡岛三个区域、七次任务采集的1000多张图像,涵盖18个语义类别和7400多个标注实例,并通过文本到掩码、掩码到掩码、掩码到文本三类实验对七种主流VLM进行了测试。结果显示,大范围景观类别的识别准确率普遍高于常规物体和海岸类别,海岸概念最具挑战性;但将常规类别在海岸与陆地数据集间对比后,并未发现仅由环境背景导致的性能差异。掩码到掩码匹配在两类场景中表现相近,而替换文本标签可显著提升部分海岸概念的识别效果。研究表明,海岸类别性能偏低主要受分割质量和语言表征方式影响,而非环境本身。
| Vision-language models (VLMs) | 视觉语言模型,一类能同时处理图像和文本、将视觉观察与自然语言概念关联的模型。 |
| Coastal environments | 沿海环境,指海岸线附近的自然场景,包含沙滩、礁石、海水等复杂视觉元素。 |
| Text-to-mask / Mask-to-mask / Mask-to-text alignment | 文本到掩码、掩码到掩码、掩码到文本对齐,三种评估视觉语言模型跨模态匹配能力的实验范式。 |
| Semantic classes | 语义类别,数据集中对图像区域进行标注的类别标签,如“沙滩”“岩石”等。 |
| Segmentation | 分割,将图像划分为具有语义意义的区域或像素级掩码的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅