该研究针对扩散模型在奖励后训练中出现的模式坍缩问题,提出了一种名为ReNFT的内部概率质量重校准方法。研究发现,在线后训练主要是在重新分配预训练阶段获得的能力上的概率质量,而非学习新的视觉内容,因此坍缩本质上是抑制而非删除,可以从生成器内部逆转。ReNFT通过无条件探测优先识别“反枢纽”提示,利用两条策略主导的混合路径生成匹配的反事实提议,并通过自适应翻转守卫的奖励排序实现拉推角色分配,最终完成修复。实验表明,在PickScore和GenEval基准上,ReNFT在保留NFT奖励98.9%和99.0%的同时,将DreamSim-Div多样性指标分别提升了58.8%和55.0%,为外部干预手段提供了有效的补充方案。
| Reward post-training | 一种训练方法,通过奖励信号对预训练模型进行微调,以优化特定目标。 |
| Mode collapse | 生成模型将概率质量集中在少数模式上,导致输出多样性丧失的现象。 |
| Probability-mass recalibration | 重新调整概率分布的质量分配,以恢复被抑制的多样性。 |
| Anti-hub prompts | 在提示中,与提示无关的偏差最容易暴露的提示,用于检测模型的无条件倾向。 |
| NFT update | 一种联合配对更新方法,用于在修复过程中同时调整生成器的参数。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅