该研究关注大语言模型在单样本解码场景下能否吸收搜索式解码所展现的能力。作者指出,现有基于可验证奖励的后训练方法通常不区分首次解码即成功的问题与在K次采样内才被解决的问题,导致固定预算下重复训练已掌握的行为。为此提出GapFT方法,依据源检查点的单样本结果筛选训练样本,专门针对Pass@K与Pass@1之间的差距,即单样本失败但K次内可解决的问题进行微调。在LogiQA 2.0和ReClor上,使用Llama-3.1-8B,GapFT较源模型Pass@1分别提升14.4和13.9个百分点,优于同等预算的均匀验证RFT,并以三分之一数据达到全量验证池微调的效果,单次解码即可匹配源模型经验证器选择的Pass@4准确率。该工作为高效利用验证信号、缩小搜索与单次解码差距提供了新思路。
| Pass@K | 在K个采样响应中至少有一个正确的概率,衡量模型在多次尝试下的潜在能力。 |
| Pass@1 | 单次采样响应正确的概率,反映模型在无搜索情况下的直接部署性能。 |
| RLVR | 可验证奖励的强化学习,利用精确验证器提供奖励信号来训练语言模型。 |
| GapFT | 本文提出的微调方法,针对Pass@K与Pass@1之间的差距进行训练,即选择单样本失败但K样本内成功的例子。 |
| RFT | 拒绝采样微调,一种使用验证器筛选正确响应进行监督微调的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅