X-Planner 是一套面向具身智能的任务规划前端系统,旨在解决现有视觉-语言-动作(VLA)系统中中间规划结构隐式化、以及思维链(CoT)规划器依赖粗粒度任务标注和逐词序列化推理的问题。该研究在数据层面融合了 Ego、UMI 与遥操作三类来源,按层级粒度组织并采用来源相关的标注深度,同时引入接管时刻标注和人工设计的失败案例来监督执行中的错误识别。模型层面,系统基于共享 VLM 主干提供两种事件结构化规划形式:输出可解释事件状态的离散接口,以及通过阶梯式解码在交错 Transformer 深度间传递连续 CoT 状态的潜在接口,并以冻结的潜在到文本重建目标为潜在表示提供语义锚点。离线两步规划评测中,X-Planner 在 BERTScore-F1 与基于评判模型的综合得分上均位列四个评测模型第二;真实机器人实验中也优于所对比的基线。该工作为规划文本质量与下游执行效果之间的关系提供了实证刻画。
| X-Planner | 本文提出的规划前端,通过事件结构化表示统一具身推理的监督与表示。 |
| Vision-Language-Action (VLA) | 视觉-语言-动作模型,将视觉感知、语言指令与机器人动作生成统一建模的系统。 |
| Chain-of-Thought (CoT) | 思维链,让模型逐步生成中间推理步骤以提升复杂任务表现的方法。 |
| Staircase Decoding | 阶梯解码,一种在交错 Transformer 深度间传递连续思维链状态的解码机制。 |
| BERTScore-F1 | 基于 BERT 嵌入的文本生成评价指标,用 F1 值衡量生成文本与参考文本的语义相似度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅