空中目标搜索新基准AerialDojo-200K:任务实例暴涨18.7倍!
AerialDojo-200K: A Large-Scale Benchmark Suite for Open-World Aerial Object-Goal Search
arXiv CV (cs.CV) 重要 Agent多模态论文方法 🕐 今天 12:00

📖 AI 总结

开放世界空中目标搜索要求无人机等空中智能体在非结构化三维环境中自主探索,并依据语义描述或参考图像找到目标物体,而非遵循固定路线指令。该任务此前研究受限于规模小、环境单一、动作空间与数据格式不统一的基准,难以支撑大规模训练与跨基准评测。为此,作者提出AerialDojo-200K基准套件,其场景数量为现有最大同类基准的3倍,任务实例达18.7倍。该套件构建了覆盖城市、自然、基础设施和灾害四类场景族的42个仿真场景,由12名标注员历时两个月标注109个地标、2099个目标物体及对应锚点,并生成205732个任务实例,涵盖语义目标与图像目标两类,分为基础、标准和长时程三种设置,每个实例均含无碰撞参考轨迹和多视角视频。配套的统一评测框架划分了21个分布内和21个分布外场景。对五种开源和四种闭源多模态大模型的评测显示,通用空中智能体仍远未实现。

🔑 关键词速览

Open-World Aerial Object-Goal Search开放世界空中目标搜索:空中智能体在未知三维环境中自主探索并到达语义或图像指定目标的任务。
AerialDojo-200K本文提出的大规模基准套件,包含42个仿真场景和超过20万个任务实例,用于开放世界空中目标搜索。
Semantic-Goal / Image-Goal语义目标/图像目标:分别通过语义描述或参考图像指定搜索目标的两种任务设定。
In-Distribution / Out-of-Distribution Scenes分布内/分布外场景:用于评估模型在训练分布内和分布外场景上的泛化能力。
Multimodal Large Language Models (MLLMs)多模态大语言模型:能够同时处理文本和图像等多种模态信息的大型语言模型,本文评估了其作为空中智能体的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅