遥感AI新突破:统一流水线图像描述82%、VQA 83.32%!
GeoNLI - A Natural Language Interpreter for Satellite Imagery
arXiv CV (cs.CV) 重要 #多模态#遥感图像#视觉定位 🕐 今天 12:00

📖 AI 总结

该研究针对遥感图像理解中统一模型难以兼顾图像描述、视觉问答(VQA)与视觉定位三类任务的难题,在VRS Bench和NWPU-VHR-10数据集上评估了多种多模态模型。结果显示EarthMind在描述与VQA任务上表现突出;在定位任务上,作者提出RemoteSAM-SAM-v1、RemoteSAM-SAM-v2和DiffuSAM等流程,并最终采用涵盖EarthMind、RemoteSAM、SAM3、Falcon及DiffuSAM等八个模型的多数投票集成方案。其模块化统一流程将SAM变体与多模态大模型结合,在描述任务上达到82%准确率,VQA达83.32%,其中二值、数值和语义类问题分别为90.94%、52.04%和92.06%,定位准确率为64.94%。该工作表明,通过集成多种视觉语言模型与定制化定位模型,可较任务专用方法获得更准确、一致的遥感理解能力。

🔑 关键词速览

VQA视觉问答,一种多模态任务,要求模型根据图像内容回答自然语言问题。
Visual Grounding视觉定位,指根据自然语言描述在图像中定位目标区域或物体的任务。
SAMSegment Anything Model,一种通用的图像分割基础模型,能够根据提示分割任意物体。
Ensemble Majority Voting集成多数投票,一种将多个模型的预测结果进行投票以决定最终输出的策略,旨在提升鲁棒性和准确性。
Multimodal LLM多模态大语言模型,能够同时处理文本和图像等多种模态输入的大规模预训练语言模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅