该研究提出了一种面向视频生成的统一偏好感知学习框架,旨在解决生成视频与人类偏好对齐中的三大核心挑战:偏好数据中的主观噪声与偏差、标量奖励模型对多维偏好动态权衡的丢失,以及KL散度在策略优化中仅提供局部约束的局限。研究采用精英引导过滤校准偏好数据,将视频质量建模为多维奖励分布以捕捉人类偏好的不确定性,并利用Wasserstein距离对齐学习到的奖励分布与经验偏好分布。此外,研究将基于Wasserstein的分布对齐引入GRPO,使策略优化更好地匹配人类偏好的全局结构。实验表明,该方法显著提升了奖励信号的可靠性和生成视频的感知一致性。该研究已被ECCV 2026接收,为视频生成的质量评估与对齐提供了新思路。
| GRPO | 一种策略优化算法,用于强化学习,通过组相对策略优化来更新策略。 |
| Wasserstein距离 | 一种度量两个概率分布之间距离的方法,能反映分布的全局结构差异。 |
| 奖励分布 | 将奖励建模为分布而非标量,以捕捉人类偏好的不确定性。 |
| 精英引导过滤 | 一种数据筛选方法,通过选择高质量样本来校准偏好数据。 |
| KL散度 | 一种衡量两个概率分布差异的指标,常用于强化学习中的约束,但仅提供局部约束。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅