🔥 今日值得一读 2398人57万次审美判断揭示:AI偏好不是噪声,是个体差异!
Learning Heterogeneous Preferences
arXiv AI (cs.AI) 🔥 重点 安全对齐论文方法 🕐 09-17 12:00

📖 AI 总结

该研究针对现有基于人类反馈的偏好学习方法普遍假设存在跨人群共享的"通用效用函数"、将标注者之间的分歧视为随机噪声这一问题,指出该假设在主观偏好领域并不成立,因为个体偏好存在系统性差异。作者借鉴理性选择理论,提出以个体及其决策情境为条件的"个体化效用函数",并设计了一种多阶段架构,从多模态数据中估计此类效用函数。研究团队新采集了包含2398名参与者、逾57.5万条关于汽车轮毂设计的两两美学判断数据集进行验证,结果表明个体化效用模型显著优于通用效用模型及基础模型基线。这一发现说明标注分歧反映的是有意义的偏好异质性而非标注噪声,凸显了采集标注者属性信息、学习个体化效用函数的重要性,有助于构建能够明确表征"代表谁的偏好"并忠实反映人类决策多样性的奖励模型。

🔑 关键词速览

Heterogeneous Preferences指不同个体之间偏好存在系统性差异,而非随机噪声。
Individuated Utility Functions以个体及其决策情境为条件的效用函数,用于建模个性化偏好。
Rational Choice Theory (RCT)理性选择理论,假设个体决策基于内部一致的效用最大化。
Reward Models奖励模型,在强化学习中用于量化人类偏好以指导策略学习。
Subjective Preference Learning主观偏好学习,研究在偏好因个体而异的主观领域中从选择中学习效用函数。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅