本文针对视觉-语言-动作(VLA)模型推理加速中潜在的任务失败风险展开研究。现有加速方法(如动作分块、视觉token剪枝)通常以延迟和平均任务成功率作为评价指标,但平均指标会掩盖加速导致的信息丢失和任务失败问题,且由于动作偏差在闭环轨迹中不断累积,这类失败只能在完整回合中观测。为此,作者将加速导致的失败定义为:在相同初始条件下进行配对 rollout,参考策略成功而加速策略失败的情形。基于此提出 CARE 方法,通过校准集上的配对 rollout,为加速导致的失败风险提供有限样本保证,确保其低于用户设定的预算,并部署通过认证的最快候选方案,若无候选合格则回退至参考策略。CARE 仅依赖终端结果和实测计算量,可适用于多种加速机制,并通过序贯检验和失败触发的参考 rollout 控制认证成本。在四个 LIBERO 套件与 OpenVLA-OFT 上,CARE 认证了 9.0 至 10.8 倍的加速,并以 95% 置信度保证至少保留 85.8% 的参考成功回合;在严格预算下,无保证的选择器在多达 75% 的试验中超出预算,而 CARE 始终保持在预算内,其序贯形式比穷举评估减少 78.9% 的 rollout。该方法还可推广至 π0.5 的流步缩减,以及 Crafter 环境中的 Qwen3.5-9B 和 Llama-3.1-8B 智能体。
| Vision-Language-Action (VLA) models | 视觉-语言-动作模型,一种结合视觉感知、语言理解和动作生成的多模态模型,用于机器人控制等任务。 |
| Action chunking | 动作分块,一种加速推理的技术,将多个连续动作打包成一个块进行预测,减少推理次数。 |
| Visual-token pruning | 视觉词元剪枝,一种通过移除不重要的视觉词元来减少计算量的加速技术。 |
| Paired rollouts | 配对推演,从相同初始条件分别运行参考策略和加速策略,以比较其表现的方法。 |
| Finite-sample guarantees | 有限样本保证,基于有限数量的样本数据提供的统计保证,确保某种风险或性能指标满足特定条件。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅