GRPO标准差分母无界放大微小差距,MaxNorm-AC有界恢复可信小差距
Advantage Scale Calibration Imbalance in Group-Relative Optimization under Low-Variance Rewards: Diagnosis and Bounded Recovery
arXiv CL (cs.CL) 重要 论文方法大模型安全对齐 🕐 09-18 12:00

📖 AI 总结

该论文聚焦验证器式强化学习(RLVR)中组相对优化的优势尺度校准问题。作者指出,优势尺度常被视为实现细节,但在低方差奖励下会引发两类截然不同的情形:一类是低于分辨率的抖动,不应被当作偏好信号;另一类是可信但较小的基数差距,应被学习而不扭曲KL校准。为此,论文提出优势尺度三方校准接口,说明同一组内尺度分母同时决定奖励分支强度、提示级批权重以及奖励分支还原到原始基数尺度时的有效KL校准。该接口解释了RLOO等方法为何使可信小差距被KL主导,而GRPO的标准差分母会无界放大微小差距。基于此,作者引入奖励分辨率协议与MaxNorm-AC,分别过滤亚分辨率差距并对可信非零差距提供有界基数恢复。在密集与MoE架构及数学、代码推理任务上,MaxNorm-AC优于最强鲁棒尺度基线,并截断了低方差逆尺度尾部。

🔑 关键词速览

RLVR基于可验证奖励的强化学习,一种利用程序化验证器提供奖励信号来训练语言模型的方法。
组相对优化在强化学习中,通过比较同一组内样本的奖励来计算优势值,从而进行策略优化的方法。
优势尺度用于缩放优势值的分母或系数,影响策略更新的幅度和方向。
KL校准在强化学习微调中,通过KL散度惩罚项控制策略偏离参考模型的程度,以保持生成质量。
MaxNorm-AC本文提出的一种有界基数恢复方法,用于在可信非零差距上限制优势尺度的极端值。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅