该研究聚焦离散token视觉-语言-动作(VLA)模型中的动作表示问题,指出现有的位姿增量表示对执行速度和数据集归一化高度敏感,容易掩盖不同演示与数据集之间共享的几何结构。为此,作者提出方向-尺度分解(DSD)表示方法,将平移和旋转增量在token化之前拆分为方向与尺度两个分量,使运动方向被单独分离,而幅度保留在独立的尺度通道中。研究在仿真与真实机器人操作任务中,结合均匀分箱(BIN)和基于B样条的BEAST分词器,在单数据集与混合数据集训练下进行评估。结果显示,在LIBERO上DSD对两种分词器均提升平均成功率;在SimplerEnv混合数据集训练下,DSD-BIN整体成功率比BIN高出10.3个百分点;真实机器人实验在有无机器人预训练的情况下也均有增益。这表明DSD是一种有效的动作表示,并有望缓解大规模多样化数据混合训练时的性能退化。
| Direction-Scale Decomposition (DSD) | 一种动作表示方法,将平移和旋转增量分解为方向与尺度分量后再进行标记化。 |
| Vision-Language-Action (VLA) Models | 结合视觉、语言和动作模态的模型,用于机器人操作等任务。 |
| Discrete-Token Action Representation | 将连续动作空间离散化为标记序列的动作表示方式,便于序列建模。 |
| BEAST | 一种基于 B 样条的标记器,用于将连续动作增量转换为离散标记。 |
| Mixed-Dataset Training | 在多个不同来源或分布的数据集混合上进行训练,以提升泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅