本文提出GAP-DPO方法,旨在解决大语言模型个性化偏好优化中偏好对选择不当导致效果下降的问题。作者将个性化偏好学习形式化为几何对齐的优化问题,通过分析用户效用梯度与DPO更新方向的一阶交互发现:在离策略采样下,当偏好边际与效用梯度方向对齐时,DPO更新会从单纯的误差纠正信号转变为类强化学习更新。这一视角表明,偏好对选择本质上是决定优化能否促进个性化的几何决策,而非启发式预处理步骤。基于此,GAP-DPO通过效用感知的几何对齐对选择,并结合逐轮重新生成控制分布偏移。在个性化文本生成基准上,该方法在风格保真度、偏好对齐和生成质量上均优于标准DPO变体,确立了梯度对齐作为个性化偏好优化的统一原则。
| Direct Preference Optimization (DPO) | 一种无需显式奖励模型即可直接优化语言模型以对齐人类偏好的方法。 |
| Gradient Alignment | 指偏好更新的梯度方向与用户效用梯度方向在几何上一致,从而促进个性化优化。 |
| Pair Selection | 在偏好学习中挑选用于训练的正负样本对的过程,影响优化方向与效果。 |
| Off-policy Sampling | 使用与当前策略不同的行为策略生成数据,常用于偏好学习中的样本采集。 |
| GAP-DPO | 本文提出的几何对齐偏好DPO算法,通过效用感知的偏好对选择和逐轮重新生成来优化个性化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅