🔥 今日值得一读 多语言RLVR翻车!Qwen3-8B日语假阴性率0.642,英语仅0.122,跨语言瓶颈修复率超95%!
Multilingual Verifier Bias in RLVR: Benchmark, Rollout Diagnosis, and the Cross-Lingual Selection Bottleneck
arXiv CL (cs.CL) 🔥 重点 #RLVR#多语言#评测基准 🕐 08-24 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此协议检测多语言强化学习奖励中的格式偏差,避免因语言变体导致错误负反馈,提升训练稳定性。

📖 AI 总结

该研究揭示了多语言强化学习(RLVR)中验证器偏差的系统性问题。作者指出,在数学推理任务中,精确匹配验证器并非语言中立,而是将格式和文字差异转化为依赖语言的假阴性奖励噪声。通过构建可复用的审计协议,研究在日语、英语和中文的MGSM数据集上进行了测试:Qwen3-8B模型在日本语答案上的假阴性率高达0.642,而英语和中文分别仅为0.122和0.073。研究进一步定位了问题机制——最终答案接口是偏差的主要来源,并发现了跨语言选择瓶颈:目标本地聚合规则可缩小55-78%的选择差距,但超过95%的修复需要真正的跨语言支持。该结论在MATH-500数据集上得到验证。研究建议,多语言RLVR奖励应在优化前按语言和答案接口进行审计。

🔑 关键词速览

RLVR基于可验证奖励的强化学习,一种利用验证器提供奖励信号来训练模型的方法。
exact-match verifier精确匹配验证器,通过比较模型输出与标准答案是否完全一致来判断正确性的验证器。
false-negative rate假阴性率,指实际正确但被错误判定为错误的样本比例。
VLB方差-语言偏差,衡量奖励误差中由语言差异引起的方差成分。
GRPO组相对策略优化,一种强化学习算法,通过组内相对比较来更新策略。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅