本文针对世界动作模型(WAMs)中预训练视频VAE编码器潜变量直接驱动下游动作策略的场景,指出量化不仅要保持重建保真度,还须维护冻结策略所依赖的潜变量契约。研究发现,直接采用NVFP4会留下未补偿的W4A4量化误差,而联合量化感知训练(QAT)虽能在Wan2.1上使重建指标接近FP32水平(VBench-7为0.7403对0.7409),却导致LIBERO任务成功率从95.5%骤降至10.5%。受控解码器实验表明,激活量化-反量化操作改变了重建信号与解码器雅可比矩阵,使回传至编码器的梯度方向偏移,引发持续性潜变量漂移。基于此机制,作者提出两阶段NVFP4 QAT框架LatentQuant:先对齐量化编码器与高精度版本,再冻结编码器并适配解码器。在Wan2.1与Wan2.2上,该方法保持了接近基线的控制性能与高重建质量,LIBERO成功率达95.75%,RoboTwin达68.8%;在NVIDIA B300 GPU上,NVFP4执行相较BF16 cuDNN实现1.17至1.26倍的端到端VAE加速。
| 世界动作模型 (WAMs) | 一种利用世界模型(如视频预测模型)来生成动作策略的模型,通常复用预训练视频VAE的潜变量作为策略输入。 |
| NVFP4 | 一种4位浮点量化格式,用于在NVIDIA GPU上高效执行低精度推理,但可能引入量化误差。 |
| 量化感知训练 (QAT) | 在训练过程中模拟量化操作,使模型适应低精度表示,以减少量化带来的性能损失。 |
| 潜变量契约 (Latent Contract) | 指预训练编码器输出的潜变量表示与下游冻结策略所期望的输入分布之间的一致性约定。 |
| VBench-7 | 一个用于评估视频生成模型质量的基准测试套件,包含7个维度的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅