🔥 今日值得一读 动作标记新突破!DSD让VLA混合数据集成功率飙升10.3个百分点
Direction-Scale Decomposition in Action Representation: Rethinking What to Tokenize for Vision-Language-Action Models
arXiv CV (cs.CV) 🔥 重点 #视觉语言动作#动作表示#机器人 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
将动作分解为方向与尺度再令牌化,降低对速度和归一化的敏感,可用于VLA模型训练与跨数据集泛化。

📖 AI 总结

该研究聚焦离散token视觉-语言-动作(VLA)模型中的动作表示问题,指出现有的位姿增量表示对执行速度和数据集归一化高度敏感,容易掩盖不同演示与数据集之间共享的几何结构。为此,作者提出方向-尺度分解(DSD)表示方法,将平移和旋转增量在token化之前拆分为方向与尺度两个分量,使运动方向被单独分离,而幅度保留在独立的尺度通道中。研究在仿真与真实机器人操作任务中,结合均匀分箱(BIN)和基于B样条的BEAST分词器,在单数据集与混合数据集训练下进行评估。结果显示,在LIBERO上DSD对两种分词器均提升平均成功率;在SimplerEnv混合数据集训练下,DSD-BIN整体成功率比BIN高出10.3个百分点;真实机器人实验在有无机器人预训练的情况下也均有增益。这表明DSD是一种有效的动作表示,并有望缓解大规模多样化数据混合训练时的性能退化。

🔑 关键词速览

Direction-Scale Decomposition (DSD)一种动作表示方法,将平移和旋转增量分解为方向与尺度分量后再进行标记化。
Vision-Language-Action (VLA) Models结合视觉、语言和动作模态的模型,用于机器人操作等任务。
Discrete-Token Action Representation将连续动作空间离散化为标记序列的动作表示方式,便于序列建模。
BEAST一种基于 B 样条的标记器,用于将连续动作增量转换为离散标记。
Mixed-Dataset Training在多个不同来源或分布的数据集混合上进行训练,以提升泛化能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅