评估框架才是关键!4.3倍解决率提升,训练方案竟无关紧要?
What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
arXiv AI (cs.AI) 重要 Agent强化学习代码生成 🕐 09-07 12:00

📖 AI 总结

这篇论文研究了多环境强化学习(multi-harness RL)在代码生成智能体训练中的实际作用。作者将“多环境”拆解为两个独立变量:暴露给策略的不同执行环境,以及训练时是否跨环境合并奖励进行相对优势计算。通过固定任务数据、仅改变奖励分组规则(组内 vs 跨组),并在多个基准及一个训练时未见过的环境上评估,研究发现:评估环境本身对求解率的影响(从2.14%到9.27%,相差4.3倍)远超训练规则的影响;而奖励分组方式对模型在新环境上的表现几乎没有差异,且其影响小于随机种子带来的波动。进一步分析表明,跨环境分组带来的优势主要源于对特定环境配置的适应,而非产生了更通用的代码能力。作者因此建议,多环境RL研究应明确报告分组边界,并使用未见过的环境进行测试。

🔑 关键词速览

Multi-harness RL一种强化学习设置,其中策略在多个执行框架(如不同的编码代理环境)中训练,以增强泛化能力。
GRPO (Group Relative Policy Optimization)一种策略优化方法,通过比较同一任务内不同样本的相对优势来更新策略。
Credit assignment信用分配,指在强化学习中确定哪个动作或决策对最终奖励贡献最大的过程。
SWE-bench Verified一个用于评估编码代理在真实软件工程任务上性能的基准测试集,此处用作密封的评估标准。
Harness执行框架,指在强化学习中运行代理并收集奖励的完整环境或工具链。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅