🔥 今日值得一读 DPO选对偏好数据竟能像强化学习一样提升个性化效果!
Gradient-Aligned Pair Selection for Personalized Preference Optimization
arXiv AI (cs.AI) 🔥 重点 #DPO#个性化#训练方法 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
改进个性化DPO的偏好对选择,让模型更贴合用户个体偏好而非平均质量。

📖 AI 总结

本文提出GAP-DPO方法,旨在解决大语言模型个性化偏好优化中偏好对选择不当导致效果下降的问题。作者将个性化偏好学习形式化为几何对齐的优化问题,通过分析用户效用梯度与DPO更新方向的一阶交互发现:在离策略采样下,当偏好边际与效用梯度方向对齐时,DPO更新会从单纯的误差纠正信号转变为类强化学习更新。这一视角表明,偏好对选择本质上是决定优化能否促进个性化的几何决策,而非启发式预处理步骤。基于此,GAP-DPO通过效用感知的几何对齐对选择,并结合逐轮重新生成控制分布偏移。在个性化文本生成基准上,该方法在风格保真度、偏好对齐和生成质量上均优于标准DPO变体,确立了梯度对齐作为个性化偏好优化的统一原则。

🔑 关键词速览

Direct Preference Optimization (DPO)一种无需显式奖励模型即可直接优化语言模型以对齐人类偏好的方法。
Gradient Alignment指偏好更新的梯度方向与用户效用梯度方向在几何上一致,从而促进个性化优化。
Pair Selection在偏好学习中挑选用于训练的正负样本对的过程,影响优化方向与效果。
Off-policy Sampling使用与当前策略不同的行为策略生成数据,常用于偏好学习中的样本采集。
GAP-DPO本文提出的几何对齐偏好DPO算法,通过效用感知的偏好对选择和逐轮重新生成来优化个性化。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅