该综述系统梳理了基于评分标准的强化学习(Rubric-Guided RL)方法,旨在解决传统RLHF中标量奖励信号缺乏可解释性、难以捕捉多维响应质量的问题。文章提出一个贝叶斯统一框架,将宪法定义为评价标准的先验分布,评分标准视为条件化实例,并沿先验-后验轴对现有方法进行分类,涵盖宪法AI、实例特定评分标准、过程级监督、自进化评分标准及其智能体和多模态扩展。此外,由于评分标准本质上是自然语言产物,文章还从语言学角度分析了粒度权衡、语义漂移和语言奖励黑客对对齐可靠性的影响,并指出未来研究的关键开放问题。该工作为理解结构化奖励设计在LLM对齐中的作用提供了系统视角。
| RLHF | 基于人类反馈的强化学习,一种通过人类偏好信号训练语言模型的方法。 |
| Rubric-guided reinforcement learning | 基于评分标准的强化学习,利用结构化评估标准指导奖励设计和策略优化。 |
| Bayesian framework | 贝叶斯框架,一种基于概率先验和后验更新的数学框架,用于统一建模评估标准。 |
| Constitutional AI | 宪法AI,一种通过一组原则或规则指导模型行为对齐的方法。 |
| Linguistic reward hacking | 语言奖励黑客,指模型利用自然语言评分标准的漏洞或歧义来获得高奖励的行为。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅