该研究针对扩散模型难以对齐个体用户偏好的问题提出了一种新方法。现有方案通常依赖人工标注或视觉语言模型从用户交互历史中提取偏好信息,标注与计算成本高昂,难以规模化。作者转而直接从用户历史图像偏好对中学习个性化奖励模型:先用自编码器将数百个视觉属性压缩为50个属性锚定的偏好维度,并训练评估器沿这些维度为图像打分;再将每位用户的偏好表示为共享维度分数的线性组合,通过Bradley-Terry模型最大化其成对偏好似然来估计用户权重。这一形式将个性化适配简化为优化低维权重向量,从而能从稀疏反馈中高效学习。实验显示,该方法在真实用户偏好数据上的留出成对偏好预测准确率约为77%,并能在保持扩散模型冻结的前提下于推理阶段引导生成,提升图像与个体偏好的对齐程度。
| 扩散模型 | 一种生成模型,通过逐步去噪过程从随机噪声中生成高质量图像。 |
| 个性化奖励模型 | 一种根据用户历史偏好学习得到的模型,用于评估图像与用户偏好的匹配程度。 |
| Bradley-Terry模型 | 一种用于成对比较数据的概率模型,通过比较结果估计各项目的相对偏好强度。 |
| 属性锚定的偏好维度 | 将视觉属性映射到一组固定的、可解释的维度,用于表示用户偏好的不同方面。 |
| 留出成对偏好预测 | 在未参与训练的用户偏好对数据上评估模型预测用户更偏好哪张图像的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅