该研究针对强化学习可验证奖励(RLVR)中常见的“pass@k交叉”现象提出统计推断框架。作者指出,模型在pass@1上提升却在更大采样预算k下落后于基座模型,这一交叉常被解读为RLVR仅锐化已有能力,但存在两个统计局限。其一,可见交叉未必统计显著:在相同提示下构建跨采样预算的置信带,需同时满足早期增益与后期损失的证据,五组公开RLVR配对在初始评估中均未确立统计显著的交叉,而32k token的新提示评估定位到反转,首次损失出现在11至61个样本之间;功效分析表明未检测到交叉不等于不存在,增加提示数比增加每提示答案数更有效。其二,基座成功率本身无法决定RLVR对提示的影响:相同基座成功率的提示在RLVR后成功率不同,且该差异在独立生成半样本中重复出现,说明二者关系是条件分布(马尔可夫核)而非单一曲线,拟合该核可预测独立生成中的交叉并修正简单模型的功效估计。理论进一步表明,少数最难提示上的损失可推翻早期领先,从而区分交叉存在的证据与关于能力含义的主张。
| RLVR | 可验证奖励的强化学习,一种利用可自动验证的奖励信号来训练语言模型的方法。 |
| pass@k | 在 k 次采样中至少有一次成功的概率,用于衡量模型在给定采样预算下的能力。 |
| 交叉(crossover) | 指 RLVR 模型在较小 k 时优于基础模型,但在较大 k 时反被基础模型超越的现象。 |
| 马尔可夫核(Markov kernel) | 描述从一个状态到另一个状态的条件概率分布,这里指给定基础成功率时 RL 后成功率的条件分布。 |
| 功效分析(power analysis) | 统计中评估检验能够检测到真实效应概率的方法,用于解释为何未检测到交叉不等于不存在交叉。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅