本文提出了一种名为 Exploration-Preserving Policy Optimization(ExPPO)的强化学习方法,旨在解决可验证奖励强化学习中探索能力退化的问题。作者指出,现有群体相对目标对同等奖励的响应赋予相同优势值,导致聚合信用与采样模式频率成正比,从而抑制了对稀有但正确解法的探索。ExPPO 通过引入基于提示相对、长度归一化的响应惊奇度与提示通过率来重新分配信用,并结合有界塑形与共享归一化,在保持验证器极性的同时近似维持每个提示组的绝对序列优势总量。理论分析刻画了响应级信用分配与采样模式更新,给出了熵增和正确模式发现增益的局部条件。实验表明,该方法在域内和域外推理覆盖率、总体响应准确率以及大采样预算下的覆盖率均有提升,多答案对照评估进一步显示正确模式产出和已验证正确响应的多样性增加。
| Exploration-Preserving Policy Optimization (ExPPO) | 一种轻量级优势塑形规则,通过重新分配信用来保持探索能力,提升推理覆盖率和正确模式发现。 |
| Group-relative objectives | 为同一组内获得相同奖励的响应分配相同优势值的目标函数,使信用与采样频率成正比。 |
| Response surprisal | 衡量响应意外程度的指标,通常基于负对数概率,用于量化响应的新颖性或信息量。 |
| Prompt pass rate | 针对给定提示,模型生成正确响应的比例,反映模型在该提示上的表现水平。 |
| Correct-mode discovery | 在采样过程中发现并利用能够产生正确响应的模式或策略的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅