这篇论文研究了多环境强化学习(multi-harness RL)在代码生成智能体训练中的实际作用。作者将“多环境”拆解为两个独立变量:暴露给策略的不同执行环境,以及训练时是否跨环境合并奖励进行相对优势计算。通过固定任务数据、仅改变奖励分组规则(组内 vs 跨组),并在多个基准及一个训练时未见过的环境上评估,研究发现:评估环境本身对求解率的影响(从2.14%到9.27%,相差4.3倍)远超训练规则的影响;而奖励分组方式对模型在新环境上的表现几乎没有差异,且其影响小于随机种子带来的波动。进一步分析表明,跨环境分组带来的优势主要源于对特定环境配置的适应,而非产生了更通用的代码能力。作者因此建议,多环境RL研究应明确报告分组边界,并使用未见过的环境进行测试。
| Multi-harness RL | 一种强化学习设置,其中策略在多个执行框架(如不同的编码代理环境)中训练,以增强泛化能力。 |
| GRPO (Group Relative Policy Optimization) | 一种策略优化方法,通过比较同一任务内不同样本的相对优势来更新策略。 |
| Credit assignment | 信用分配,指在强化学习中确定哪个动作或决策对最终奖励贡献最大的过程。 |
| SWE-bench Verified | 一个用于评估编码代理在真实软件工程任务上性能的基准测试集,此处用作密封的评估标准。 |
| Harness | 执行框架,指在强化学习中运行代理并收集奖励的完整环境或工具链。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅