本文提出ExploreNet,针对扩散模型GRPO类强化学习后训练中探索噪声分配不合理的问题展开研究。现有方法(如Flow-GRPO)在每个去噪步骤对潜变量所有通道和空间位置均匀添加各向同性高斯噪声,但作者发现不同潜变量元素对生成图像的影响程度存在显著差异,因此探索应随元素重要性自适应调整。ExploreNet是一个策略网络,依据当前潜变量、去噪步骤和提示词,在观测奖励之前为每个潜变量元素预测噪声尺度,并利用各rollout组的奖励分布进行训练,训练完成后即被丢弃,不改变推理过程。在Stable Diffusion 3.5 Medium上,该方法使留出集GenEval2指标较Flow-GRPO提升14%,并可迁移至两个独立组合性基准和五个偏好与图像质量模型,人类偏好胜率达67.2%。研究进一步表明,探索分布是可学习的,其形状比幅度更重要,且rollout质量比数量更关键。
| Flow-GRPO | 一种基于组相对策略优化的扩散模型后训练方法,通过在去噪过程中添加各向同性高斯噪声进行探索。 |
| EXPLORENET | 本文提出的自适应探索策略网络,根据当前潜变量、去噪步骤和提示词为每个潜变量元素预测噪声尺度。 |
| 潜变量元素 | 扩散模型潜在空间中的基本单元,包括通道和空间位置,其变化对生成图像的影响程度不同。 |
| GenEval2 | 一个用于评估文本到图像生成模型组合能力的基准测试集,本文中作为留出评估指标。 |
| 组相对强化学习 | 一种强化学习范式,通过比较同一组内多个 rollout 的奖励来优化策略,无需绝对奖励基线。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅