这篇论文针对视觉语言导航(VLN)长期局限于单智能体执行单条指令的问题,首次将多智能体VLN系统性地形式化为带约束的协同问题:每个任务由具有依赖关系和资源约束(存在锁与持有链)的子任务构成。作者通过四阶段构建流程提出MAVLN基准,涵盖145个场景、11724个回合,支持最多四个智能体在三种指令模式下的协作,并设计了约束感知的评价指标。方法上提出TRISS系统,结合基于大语言模型的子任务调度器、将各智能体探索转化为团队知识的共享拓扑记忆,以及将并发意图转化为无碰撞路径的冲突感知执行机制。实验表明TRISS可作为综合基线,同时在调度、规划与执行层面仍有较大提升空间,凸显了多智能体在约束条件下协同导航的挑战。
| Vision-and-Language Navigation (VLN) | 视觉与语言导航,指智能体根据自然语言指令在视觉环境中导航的任务。 |
| Multi-Agent VLN (MAVLN) | 多智能体视觉与语言导航,本文提出的多机器人团队协作完成导航任务的新设定与基准。 |
| Presence locks and holding chains | 存在锁与持有链,本文定义的两类资源约束,用于描述子任务对智能体存在和物品持有的依赖关系。 |
| TRISS | 本文提出的协调就绪导航系统,包含LLM子任务调度器、共享拓扑记忆和冲突感知执行机制。 |
| Constraint-aware metrics | 约束感知度量指标,针对MAVLN任务中的依赖和资源约束设计的评估标准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅