该研究针对遥感图像理解中统一模型难以兼顾图像描述、视觉问答(VQA)与视觉定位三类任务的难题,在VRS Bench和NWPU-VHR-10数据集上评估了多种多模态模型。结果显示EarthMind在描述与VQA任务上表现突出;在定位任务上,作者提出RemoteSAM-SAM-v1、RemoteSAM-SAM-v2和DiffuSAM等流程,并最终采用涵盖EarthMind、RemoteSAM、SAM3、Falcon及DiffuSAM等八个模型的多数投票集成方案。其模块化统一流程将SAM变体与多模态大模型结合,在描述任务上达到82%准确率,VQA达83.32%,其中二值、数值和语义类问题分别为90.94%、52.04%和92.06%,定位准确率为64.94%。该工作表明,通过集成多种视觉语言模型与定制化定位模型,可较任务专用方法获得更准确、一致的遥感理解能力。
| VQA | 视觉问答,一种多模态任务,要求模型根据图像内容回答自然语言问题。 |
| Visual Grounding | 视觉定位,指根据自然语言描述在图像中定位目标区域或物体的任务。 |
| SAM | Segment Anything Model,一种通用的图像分割基础模型,能够根据提示分割任意物体。 |
| Ensemble Majority Voting | 集成多数投票,一种将多个模型的预测结果进行投票以决定最终输出的策略,旨在提升鲁棒性和准确性。 |
| Multimodal LLM | 多模态大语言模型,能够同时处理文本和图像等多种模态输入的大规模预训练语言模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅