该研究提出了一种名为奖励速度匹配(RVM)的扩散模型奖励微调新方法。传统方法依赖策略梯度机制,需通过随机去噪轨迹或证据下界构造似然函数,计算复杂且算法繁琐。RVM直接作用于速度场,强化高奖励生成方向、抑制低奖励方向,并可选锚定项控制参考速度漂移,完全绕开似然计算。该方法是一个通用框架,可涵盖RAM和DiffusionNFT等现有方法。实验表明,在多种大规模扩散模型奖励微调任务中,RVM以显著更低的训练成本达到或超越基于轨迹的策略梯度方法性能。研究还发现,简化速度更新后,损失函数变体对结果影响较小,而奖励设计和锚定设计更为关键。针对视频生成,标准偏好奖励易导致视觉清晰但近乎静态的输出,引入动态追踪奖励可大幅改善运动质量并提升VBench综合评分。该研究证明,扩散模型的奖励微调更适合在原生速度表征中求解,而非基于似然的策略优化。
| Reward Fine-tuning | 奖励微调,一种通过奖励信号调整模型以适应特定目标或偏好的训练方法。 |
| Velocity Matching | 速度匹配,一种直接作用于扩散模型速度场的训练方法,用于奖励微调。 |
| Policy Gradient | 策略梯度,一种强化学习算法,通过梯度上升优化策略以最大化累积奖励。 |
| Evidence Lower Bound (ELBO) | 证据下界,用于近似难以计算的似然函数的下界,常用于变分推断。 |
| Diffusion Model | 扩散模型,一种生成模型,通过逐步去噪从噪声中生成数据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅