本文提出"引导增强GRPO"(GA-GRPO)统一理论框架,将外部引导(专家轨迹、自解释或检索思维模式)建模为改写问题分布的随机引导算子G,并把由此得到的策略梯度估计量分析为有偏的在线策略估计量,其偏差由引导分布与策略自身分布之间的全变差散度δ_G界定。该框架将vanilla GRPO、LUFFY、ExPO、PAPO和TAPO统一为不同G选择下的特例。理论证明GA-GRPO以O(1/√T)速率收敛至GRPO稳定点附近O(δ√T)邻域,给出MSE最优引导权重的闭式解,并证明Ω(δ²T)偏差项不可消除的下界。在Qwen2.5-Math-7B-Base上的九项数学及分布外基准实验表明,最优权重GA-GRPO达到或超越现有方法,同时节省31%的GPU时间。
| GA-GRPO | 指导增强的GRPO,一个将外部指导统一建模为随机算子并分析其偏差-方差权衡的理论框架。 |
| RLVR | 基于可验证奖励的强化学习,利用可自动验证的奖励信号来训练大语言模型进行多步推理的主流范式。 |
| 外部指导 | 在强化学习中引入的额外信息,如专家轨迹、自解释或检索到的思维模式,用于引导模型推理。 |
| 指导散度 delta_G | 衡量指导增强采样分布与策略自身分布之间差异的全变差距离,用于界定策略梯度估计器的偏差。 |
| 最优指导权重 lambda-star | 在均方误差意义下最优的指导信号加权系数,其闭式解平衡了偏差与方差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅