本文提出MaD-RL,一个基于强化学习的通用分布匹配框架,用于校准大语言模型输出的潜在类别属性分布,使其逼近指定目标分布。作者指出,GRPO等主流后训练方法会因策略概率向单一模式集中而降低输出多样性,而熵正则化与采样温度虽能缓解这一问题,却受限于token空间且只能趋向均匀分布,效果有限。研究进一步证明,已有相关工作可视为分布匹配在L2散度下的特例,并据此提出基于KL散度和Jensen-Shannon散度的奖励函数,给出理论依据。在数学推理与编程任务上的实验验证了该方法的有效性。这一工作为合成数据生成、公平性约束满足和策略探索等需要控制输出分布而非仅最大化期望奖励的场景,提供了更通用的后训练思路。
| Distribution Matching | 分布匹配,一种通过强化学习调整模型输出分布以匹配目标分布的方法。 |
| Group Relative Policy Optimization (GRPO) | 组相对策略优化,一种主流的强化学习后训练算法,用于优化语言模型策略。 |
| KL Divergence | KL散度,衡量两个概率分布差异的非对称度量,常用于分布匹配。 |
| Jensen-Shannon Divergence | Jensen-Shannon散度,一种对称且平滑的分布差异度量,基于KL散度。 |
| Entropy Regularization | 熵正则化,在强化学习中添加熵项以鼓励策略探索,防止过早收敛。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅