🔥 今日值得一读 离线偏好对齐新突破:FlowCPO无需在线采样,GenEval冲到0.84!
FlowCPO: A Unified Divergence View of Preference Alignment for Flow Models
arXiv ML (stat.ML) 🔥 重点 #偏好对齐#扩散模型#流模型 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
为流/扩散模型提供离线偏好对齐方法,开发者无需在线采样即可微调生成模型。

📖 AI 总结

本文提出 FlowCPO,从散度视角统一梳理了流模型与扩散模型偏好对齐中的在线强化学习与离线偏好优化方法,指出前者依赖当前模型的新鲜采样、后者多局限于仅正样本微调或 DPO 式似然比代理。作者将 FlowCPO 设计为离线前向 KL 目标,同时利用偏好与非偏好样本且无需在线采样,并证明在线性插值及明确正则条件下,该目标可被对比式流匹配损失上界约束,从而在固定数据上获得可优化代理;同时指出该损失非负,而简化 FlowDPO 的有符号回归损失可能无下界。实验中,域内设置下 FlowCPO 在 CFG 3.0 时 GenEval 与 OCR 均分达 0.84 和 0.87,优于 FlowDPO 的 0.81 和 0.74;域外结果则喜忧参半,GenEval 最佳但部分指标奖励低于 RFT。

🔑 关键词速览

FlowCPO一种用于流模型的离线偏好对齐方法,通过前向KL目标同时利用偏好和非偏好样本,无需在线采样。
前向KL目标一种散度度量,用于衡量模型分布与目标分布之间的差异,在FlowCPO中作为优化目标。
对比流匹配损失一种用于训练流模型的损失函数,通过对比正负样本对来学习匹配流场。
FlowDPO流模型上的直接偏好优化方法,使用有符号回归损失,但可能下界无界。
CFG无分类器引导,一种在生成模型中通过调整条件和非条件预测的权重来控制生成质量的技术。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅