本文研究可验证奖励强化学习(RLVR)在奖励信号不明确的开放域问答任务中是否适用于小规模模型。作者以Qwen3.5-0.8B为基础模型,采用GRPO算法并接入维基百科搜索工具,在MuSiQue数据集上训练,仅改变奖励函数形态,并在七个问答基准上评估各检查点。结果显示,最佳运行取得0.352的平均精确匹配分数,较未训练基线0.092提升3.8倍,且训练过程无需从大模型蒸馏。研究还发现奖励设计至关重要:忠实于Search-R1的纯精确匹配奖励在三个随机种子和匹配训练步数下均为最差,甚至在其直接优化的精确匹配指标上也表现最差。作者据此指出,数学和代码任务中默认的稀疏精确匹配奖励并不适合此规模模型,小模型RLVR需要专门的奖励设计研究,而非简单缩放大模型方案。
| RLVR(可验证奖励强化学习) | 一种强化学习方法,使用可自动验证的奖励信号(如答案精确匹配)来训练模型,常用于数学和编程任务。 |
| GRPO(组相对策略优化) | 一种强化学习优化算法,通过比较同一组内多个采样输出的相对优劣来更新策略,无需价值网络。 |
| reason-over-search(先推理后搜索) | 一种开放域问答范式,模型先进行推理,再通过检索工具搜索外部知识,检索结果用于支撑答案。 |
| MuSiQue | 一个多跳问答数据集,问题需要组合多个文档中的信息才能回答,常用于评估检索增强推理能力。 |
| exact match(精确匹配) | 一种评估指标,衡量模型生成的答案与参考答案完全一致的比例,常用于问答任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅