该论文针对多变量有序偏好数据(如MovieLens中的电影评分、HelpSteer中对大语言模型回复的多属性人工反馈)提出了一种协变量依赖的联合建模方法。现有标准做法存在两个不足:一是将各属性分别独立建模而非联合考虑,二是将有序数据粗化为成对或列表式的胜负比较,以便套用Bradley-Terry或Plackett-Luce等比较模型,这两种做法都损失了原始观测信息。作者提出协变量依赖的连续比率马尔可夫随机场模型,对多属性有序偏好进行联合建模,并证明成对与列表式比较模型均可作为该联合模型在特定约束下的特例,且联合建模能改善比较效果。针对归一化常数不可解的问题,作者还发展了最大似然推断方法。该工作为推荐系统和大语言模型人类偏好对齐等场景提供了更充分保留原始有序信息的建模框架。
| 多元有序数据 | 指多个变量同时具有有序类别(如1-5分评分)的数据类型。 |
| 协变量依赖 | 模型参数或结构依赖于外部协变量(如用户年龄、性别)的特性。 |
| 连续比率马尔可夫随机场 | 一种用于建模有序数据的概率图模型,通过连续比率构建条件概率。 |
| Bradley-Terry模型 | 用于成对比较数据的经典概率模型,常用于排名和偏好学习。 |
| Plackett-Luce模型 | 用于列表式比较数据的概率模型,可视为Bradley-Terry模型的扩展。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅