首次把多机器人导航做成受约束协调问题,1.1万回合、145场景,最多4机协作!
Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method
arXiv CV (cs.CV) 重要 Agent多模态论文方法 🕐 今天 12:00

📖 AI 总结

这篇论文针对视觉语言导航(VLN)长期局限于单智能体执行单条指令的问题,首次将多智能体VLN系统性地形式化为带约束的协同问题:每个任务由具有依赖关系和资源约束(存在锁与持有链)的子任务构成。作者通过四阶段构建流程提出MAVLN基准,涵盖145个场景、11724个回合,支持最多四个智能体在三种指令模式下的协作,并设计了约束感知的评价指标。方法上提出TRISS系统,结合基于大语言模型的子任务调度器、将各智能体探索转化为团队知识的共享拓扑记忆,以及将并发意图转化为无碰撞路径的冲突感知执行机制。实验表明TRISS可作为综合基线,同时在调度、规划与执行层面仍有较大提升空间,凸显了多智能体在约束条件下协同导航的挑战。

🔑 关键词速览

Vision-and-Language Navigation (VLN)视觉与语言导航,指智能体根据自然语言指令在视觉环境中导航的任务。
Multi-Agent VLN (MAVLN)多智能体视觉与语言导航,本文提出的多机器人团队协作完成导航任务的新设定与基准。
Presence locks and holding chains存在锁与持有链,本文定义的两类资源约束,用于描述子任务对智能体存在和物品持有的依赖关系。
TRISS本文提出的协调就绪导航系统,包含LLM子任务调度器、共享拓扑记忆和冲突感知执行机制。
Constraint-aware metrics约束感知度量指标,针对MAVLN任务中的依赖和资源约束设计的评估标准。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅