该研究针对当前强化学习与可验证奖励(RLVR)及组相对策略优化(GRPO)在非英语和多语言环境中的空白,开展了大规模实证分析。研究覆盖多种基础模型、训练语言及不同推理语言奖励设置,发现用母语训练推理与用英语训练之间的性能差距通常较小,且存在显著的跨语言迁移效应——单一语言训练往往能提升多种其他语言的表现。然而,具体效果高度依赖模型和语言组合,某些语言训练甚至会导致其他语言领域外能力的严重退化。研究强调,RLVR在英语之外虽能带来广泛的跨语言收益,但必须辅以全面的多语言评估,以识别并规避语言特定的性能回退风险。该工作为多语言推理模型的训练策略提供了重要参考。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅