这篇论文探讨如何让自主编码智能体更可靠地修复代码仓库问题。作者指出,额外的推理计算只有在产生有效修复并提供可靠选择依据时才有价值,而位置多样性不足、编辑多样性未被利用、自写测试验证不可靠这三种行为是可以通过训练习得的,而非单纯依赖模型规模。研究通过执行反馈引导搜索,并针对每个补丁的回退树进行评分,以48.1%的智能体步数解决了SWE-bench Verified中52.8%的问题。训练方面,加权监督微调将pass@1从31.9%提升至35.2%,强化学习进一步将pass@1提升至43.0%、pass@8提升至60.7%,验证器精确率从26.8%升至41.7%,误接受率减半。该成果在多个模型规模和分布外测试集上均保持增益,表明可靠编码能力可被有效训练进策略之中。
| SWE-bench Verified | 一个用于评估自主编码智能体解决真实软件仓库问题能力的基准测试集。 |
| pass@1 / pass@8 | 评估指标,分别表示模型第一次尝试就成功解决问题的比例,以及允许八次尝试中至少有一次成功的比例。 |
| 监督微调 (SFT) | 一种使用标注数据对预训练模型进行进一步训练的技术,以使其适应特定任务。 |
| 强化学习 (RL) | 一种通过奖励信号训练模型以优化其行为策略的机器学习范式。 |
| 验证器精确率 | 衡量验证器正确识别正确补丁的能力的指标,即被验证器接受的补丁中真正正确的比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅