本文提出了一种名为“牛顿匹配”的统一框架,用于生成建模中的微调和采样。其核心目标是通过迭代优化标准条件匹配的总体最小化器,实现对目标密度π∝μe^(τr)的逼近,其中r为奖励,τ为逆温度,μ为预训练模型终端密度或常数1。该框架将Fisher-Rao度量与混合联络传输至正则速度流形,证明了反向KL散度的Hessian等于该度量,从而牛顿方向等同于负Fisher-Rao梯度。理论分析表明,理想迭代在0<η≤τ时严格下降,全步长下具有局部二次收敛性。方法无需重要性采样或全轨迹反向传播,并可通过协方差与梯度形式实现样本级更新。该框架统一了多种现有方法,为生成模型的强化学习提供了模块化算法设计基础。
| Newton Matching | 一种统一的生成建模框架,通过牛顿方向优化实现微调和采样。 |
| Fisher-Rao metric | 概率分布流形上的黎曼度量,用于衡量分布间的差异。 |
| reverse-KL divergence | 反向 KL 散度,衡量目标分布与模型分布之间的不对称差异。 |
| terminal density | 生成过程最终时刻的概率密度,用于定义模型输出分布。 |
| canonicalization | 将速度场投影到保持终端密度的规范流形上的操作。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅