该论文提出了一种名为RA-GRPO的强化学习偏好对齐框架,用于改进扩散模型在视觉生成任务中的表现。针对现有策略梯度方法探索效率低、易陷入局部最优的问题,作者引入“扩散反思”机制,通过弱估计器反转扩散过程来修正中间采样轨迹,将潜在状态引导至真实数据流形的高概率区域。同时,论文设计了“反事实路径合成”方法,将修正后的轨迹隐式蒸馏到策略中,使模型内化搜索式探索的优势而不增加推理开销。在文本到图像和文本到视频任务上的实验表明,RA-GRPO显著优于现有方法,尤其在缓解奖励黑客现象和提升泛化能力方面效果突出。该方法与架构无关,可无缝集成到标准流程中,为稳定的偏好对齐提供了新方向。
| Diffusion Reflection | 一种通过反转扩散过程并利用弱估计器修正中间采样轨迹的方法,引导潜在状态朝向真实数据流形的高概率区域。 |
| Counterfactual Path Synthesis | 一种隐式蒸馏修正轨迹到策略中的技术,使模型内化搜索式探索的好处,且不增加推理开销。 |
| RA-GRPO | 反思感知GRPO,一种基于强化学习的偏好对齐框架,结合反思机制以提升扩散模型的生成质量。 |
| Reward Hacking | 奖励黑客攻击,指模型过度优化奖励信号而偏离真实目标,导致生成结果失真或不符合人类偏好的现象。 |
| Preference Alignment | 偏好对齐,指调整生成模型的行为以符合人类偏好或价值判断的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅