该研究针对野火监测中真实视频与物理标注难以同步获取、高保真三维模拟成本高昂的问题,提出了一种基于模拟的视觉语言模型(VLM)智能体框架。该方法利用固定的Blender映射,将二维野火模拟自动转换为与地形、燃料分布、火情及风场线索对齐的低细节三维代理,并通过可控视频生成丰富外观表现。这些代理作为中间表示,与模拟器标签共同构成可复用的多模态记忆,支撑一个无需训练的多智能体VLM系统完成参考片段检索、视觉与记忆预测的协调,并生成结构化野火报告。在留出生成的片段上,视频记忆实现51.5%的四标签精确准确率,显著高于直接VLM查询的22.6%和纯文本记忆的16%至17%;完整系统在六个模拟器衍生报告字段上达到77.3%的准确率。研究还通过组件消融、跨生成器测试及三次真实无人机评估验证了检索、报告与监测任务的有效性,为物理标注稀缺条件下的野火智能监测提供了新路径。
| Vision-Language Model (VLM) | 视觉语言模型,一种能同时处理图像和文本信息的人工智能模型。 |
| Simulation-Grounded | 基于模拟的,指利用计算机模拟生成的数据来训练或评估模型。 |
| Multi-Agent System | 多智能体系统,由多个自主智能体协作完成任务的系统。 |
| Training-Free | 免训练的,指系统无需额外训练即可直接使用。 |
| Multimodal Memory | 多模态记忆,存储和检索多种类型数据(如视频、文本)的记忆机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅