该论文提出了一种名为DM-Align的统一单阶段优化框架,用于解决视频生成模型中人类偏好对齐与蒸馏分离导致的效率低下和模型崩溃问题。传统方法通常先进行强化学习再进行蒸馏,或反之,前者计算开销巨大,后者易导致模型退化。DM-Align基于分布匹配理论,同时推导出两个互补的梯度方向:一个用于最小化真实与生成模型间的分布差距以提升生成质量,另一个利用偏好对或组内探索构建的分布差异来引导模型朝人类偏好方向优化。该方法无需多步奖励评估和复杂的ODE-SDE转换,显著降低了计算成本。在多个基础视频模型上的实验表明,该框架能同时增强蒸馏质量和偏好对齐效果,性能优于独立的单阶段变体及传统的两阶段流水线方法。
| Distribution Matching (DM) | 一种优化框架,通过匹配真实数据分布与生成模型分布来训练模型。 |
| Reinforcement Learning (RL) | 一种通过奖励信号指导模型学习的机器学习方法,但计算成本高。 |
| DM-Align | 本文提出的方法,通过互补梯度方向将模型引导至人类偏好样本。 |
| DPO | 直接偏好优化,一种利用偏好对直接优化模型的方法。 |
| GRPO | 组内相对策略优化,一种通过组内探索构建分布差距的强化学习变体。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅