该研究揭示了多语言强化学习(RLVR)中验证器偏差的系统性问题。作者指出,在数学推理任务中,精确匹配验证器并非语言中立,而是将格式和文字差异转化为依赖语言的假阴性奖励噪声。通过构建可复用的审计协议,研究在日语、英语和中文的MGSM数据集上进行了测试:Qwen3-8B模型在日本语答案上的假阴性率高达0.642,而英语和中文分别仅为0.122和0.073。研究进一步定位了问题机制——最终答案接口是偏差的主要来源,并发现了跨语言选择瓶颈:目标本地聚合规则可缩小55-78%的选择差距,但超过95%的修复需要真正的跨语言支持。该结论在MATH-500数据集上得到验证。研究建议,多语言RLVR奖励应在优化前按语言和答案接口进行审计。
| RLVR | 基于可验证奖励的强化学习,一种利用验证器提供奖励信号来训练模型的方法。 |
| exact-match verifier | 精确匹配验证器,通过比较模型输出与标准答案是否完全一致来判断正确性的验证器。 |
| false-negative rate | 假阴性率,指实际正确但被错误判定为错误的样本比例。 |
| VLB | 方差-语言偏差,衡量奖励误差中由语言差异引起的方差成分。 |
| GRPO | 组相对策略优化,一种强化学习算法,通过组内相对比较来更新策略。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅