🔥 今日值得一读 小模型靠可验证奖励强化学习,平均精确匹配从0.092飙到0.352,暴涨3.8倍!
Reinforcement Learning with Verifiable Rewards for Small Search Agents
arXiv AI (cs.AI) 🔥 重点 #RLVR#搜索智能体#小模型#开放域问答 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
小模型也能做搜索推理?本文验证RLVR在10亿参数以下直接训练搜索智能体的可行性,省去蒸馏成本。

📖 AI 总结

本文研究可验证奖励强化学习(RLVR)在奖励信号不明确的开放域问答任务中是否适用于小规模模型。作者以Qwen3.5-0.8B为基础模型,采用GRPO算法并接入维基百科搜索工具,在MuSiQue数据集上训练,仅改变奖励函数形态,并在七个问答基准上评估各检查点。结果显示,最佳运行取得0.352的平均精确匹配分数,较未训练基线0.092提升3.8倍,且训练过程无需从大模型蒸馏。研究还发现奖励设计至关重要:忠实于Search-R1的纯精确匹配奖励在三个随机种子和匹配训练步数下均为最差,甚至在其直接优化的精确匹配指标上也表现最差。作者据此指出,数学和代码任务中默认的稀疏精确匹配奖励并不适合此规模模型,小模型RLVR需要专门的奖励设计研究,而非简单缩放大模型方案。

🔑 关键词速览

RLVR(可验证奖励强化学习)一种强化学习方法,使用可自动验证的奖励信号(如答案精确匹配)来训练模型,常用于数学和编程任务。
GRPO(组相对策略优化)一种强化学习优化算法,通过比较同一组内多个采样输出的相对优劣来更新策略,无需价值网络。
reason-over-search(先推理后搜索)一种开放域问答范式,模型先进行推理,再通过检索工具搜索外部知识,检索结果用于支撑答案。
MuSiQue一个多跳问答数据集,问题需要组合多个文档中的信息才能回答,常用于评估检索增强推理能力。
exact match(精确匹配)一种评估指标,衡量模型生成的答案与参考答案完全一致的比例,常用于问答任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅