本文针对文本到图像扩散模型在多样性与用户偏好满足之间的权衡问题提出新方法。现有方案要么分别处理奖励与多样性,要么将其合并为单一总分,导致高多样性可能掩盖低奖励的缺陷。作者将生成过程重新定义为"满足式"框架:每张图像须达到奖励下限,整批图像须满足多样性阈值,并证明调整奖励下限可勾勒出一条帕累托前沿。为遍历该前沿,作者提出免训练的推理时方法SatisDive,通过批内相对奖励截断区分高低奖励候选,对低奖励者侧重提升奖励,对高奖励者侧重保持多样性。在Pick-a-Pic数据集上,匹配DreamSim指标时,SatisDive将最差候选奖励较FK steering分别提升最多0.43(FLUX.1-dev基座、HPSv3奖励)和0.70(SANA-1.6B基座、ImageReward奖励),且在重叠DreamSim区间内,其满足度-多样性曲线在各设定下均帕累托优于FK steering。
| SatisDive | 一种无需训练的推理时方法,通过批次相对的奖励截止值来平衡奖励与多样性。 |
| 奖励下限 (reward floor) | 一个阈值,要求每张生成图像必须达到的最低奖励值。 |
| 多样性截止值 (diversity cutoff) | 一个阈值,要求一批生成图像必须达到的最低多样性水平。 |
| 帕累托前沿 (Pareto frontier) | 在多目标优化中,表示无法在不牺牲一个目标的情况下改进另一个目标的最优解集合。 |
| FK steering | 一种现有的文本到图像生成引导方法,用于平衡奖励和多样性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅