🔥 今日值得一读 RLVR越大采样越拉胯?32k token实测首次反转,11到61样本就露馅
RLVR is a Kernel, Not a Function: Statistical Inference for pass@$k$ Crossovers
arXiv ML (stat.ML) 🔥 重点 #RLVR#统计推断#评测方法 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
为开发者提供统计检验工具,判断RLVR模型与基座的pass@k交叉是否真实存在。

📖 AI 总结

该研究针对强化学习可验证奖励(RLVR)中常见的“pass@k交叉”现象提出统计推断框架。作者指出,模型在pass@1上提升却在更大采样预算k下落后于基座模型,这一交叉常被解读为RLVR仅锐化已有能力,但存在两个统计局限。其一,可见交叉未必统计显著:在相同提示下构建跨采样预算的置信带,需同时满足早期增益与后期损失的证据,五组公开RLVR配对在初始评估中均未确立统计显著的交叉,而32k token的新提示评估定位到反转,首次损失出现在11至61个样本之间;功效分析表明未检测到交叉不等于不存在,增加提示数比增加每提示答案数更有效。其二,基座成功率本身无法决定RLVR对提示的影响:相同基座成功率的提示在RLVR后成功率不同,且该差异在独立生成半样本中重复出现,说明二者关系是条件分布(马尔可夫核)而非单一曲线,拟合该核可预测独立生成中的交叉并修正简单模型的功效估计。理论进一步表明,少数最难提示上的损失可推翻早期领先,从而区分交叉存在的证据与关于能力含义的主张。

🔑 关键词速览

RLVR可验证奖励的强化学习,一种利用可自动验证的奖励信号来训练语言模型的方法。
pass@k在 k 次采样中至少有一次成功的概率,用于衡量模型在给定采样预算下的能力。
交叉(crossover)指 RLVR 模型在较小 k 时优于基础模型,但在较大 k 时反被基础模型超越的现象。
马尔可夫核(Markov kernel)描述从一个状态到另一个状态的条件概率分布,这里指给定基础成功率时 RL 后成功率的条件分布。
功效分析(power analysis)统计中评估检验能够检测到真实效应概率的方法,用于解释为何未检测到交叉不等于不存在交叉。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅