该研究探讨了多元对齐中的可操控模型问题:由于人们价值观多样且常相互冲突,单一对齐模型无法满足所有人,因此需要能平衡不同目标的模型。作者基于多目标直接偏好优化(MODPO)方法,研究两个核心问题:一个模型何时能同时改进两个目标,以及如何在不单独训练每个模型的情况下覆盖多种权衡方案。研究选取HelpSteer和UltraFeedback中的七组目标对,发现两项预训练测量指标能预测人类标注数据中目标是协同还是冲突,但在AI标注数据上失效,原因是回复长度和重复度干扰了奖励模型评分。在权衡覆盖方面,选择最近训练模型和合并模型参数均有一定效果,但都无法稳定达到直接训练的水平。该研究为构建服务多元偏好的可操控模型提供了实践指导。
| Pluralistic Alignment | 多元对齐,指让模型能够适配不同人群多样甚至相互冲突的价值观,而非追求单一的对齐标准。 |
| MODPO | 多目标直接偏好优化,一种通过目标权重在多个偏好目标之间连续调节权衡的模型对齐方法。 |
| Objective Conflict | 目标冲突,指两个优化目标难以同时提升、往往需要此消彼长的关系。 |
| Trade-off Coverage | 权衡覆盖,指模型能够覆盖并服务于多种不同目标权衡组合的能力范围。 |
| Reward Model | 奖励模型,用于对模型输出进行打分以近似人类偏好的模型,常作为对齐训练的优化信号。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅