这篇论文旨在揭开强化学习(RL)后训练在大型语言模型(LLM)中的“黑箱”机制,系统拆解了RL后训练的各个步骤。研究在受控简化环境中,使用可验证奖励的RL,考察了基础模型的先验分布、奖励信号的粒度、提示分布的多样性以及模型规模对训练结果的影响。作者以策略输出分布的熵为透镜,对比了预训练、监督微调和RL后训练各阶段对模型确定性的塑造作用。关键发现包括:“虚假奖励”的效果取决于后训练所用的提示分布;RL后训练的成功与否,依赖于基础模型是否已对目标行为赋予足够的概率质量,这与经典RL中的探索概念紧密相关。该研究为NLP社区提供了将RL纳入工具集的实用指南,有助于更深入地理解和应用RL后训练。
| Reinforcement Learning (RL) | 强化学习,一种通过与环境交互并基于奖励信号优化策略的机器学习方法。 |
| Post-training | 后训练,指在预训练和指令微调之后,使用特定方法(如RL)进一步优化模型的过程。 |
| Verifiable Rewards | 可验证奖励,指那些可以客观验证正确性的奖励信号,如数学答案的对错。 |
| Entropy | 熵,在信息论中衡量概率分布的不确定性,此处用于分析模型输出分布的确定性。 |
| Spurious Rewards | 虚假奖励,指那些与真实目标无关但可能误导学习过程的奖励信号。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅