🔥 今日值得一读 编码代理老翻车?ExecCritic把测试和修复拆开练,SWE-bench解决率直冲65.3%!
ExecCritic: Learn to Test, Test to Improve for Coding Agents
arXiv AI (cs.AI) 🔥 重点 #Agent#代码生成#RLHF 🕐 09-08 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用ExecCritic训练编码智能体,分离测试生成与代码修复,避免自写自测的假阳性,提升仓库级bug修复准确率。

📖 摘要

提出ExecCritic框架,通过测试-验证-修订流程和角色强化学习提升编码智能体修复能力。

🔑 关键词速览

ExecCritic一种结合测试-验证-修订框架和角色特定强化学习训练编码代理的方法。
test-verify-revise scaffold一种将测试生成、验证和代码修订分离的框架,以提高修复准确性。
role-specific reinforcement learning针对不同角色(如测试代理和修复代理)分别进行强化学习训练的策略。
SWE-bench Verified一个用于评估编码代理在真实软件工程任务上性能的基准数据集。
Base-to-Gold success衡量测试代理生成的测试能否区分基础补丁和正确补丁的指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅