自博弈代码生成新突破:CoVer框架7B模型pass@1飙升5.8分,14B提升7.1分!
Information-Gain Rewards over Diversity-Pruned Tests: GT-Anchored Verifier Co-Training for Reliable Code Generation
arXiv AI (cs.AI) 重要 代码生成强化学习论文方法 🕐 今天 12:00

📖 AI 总结

该研究针对代码生成强化学习中自博弈方法的两大缺陷——宽松性坍塌(模型通过生成无区分度的简单测试来刷高通过率)和集中偏差(独立同分布采样导致测试集中于常见输入、估计方差增大)——提出CoVer框架。其核心设计包含两项机制:一是基于信息增益的奖励函数,以自生成测试的通过/失败向量与真实标注正确性信号之间的互信息来评分,并通过协方差符号门控确保只有具备正向区分能力的测试获得奖励;二是三阶段多样性感知筛选,依次经过无效性、输入字符串和执行轨迹过滤,在固定执行预算下剔除行为冗余的测试,提升有效样本量。在LiveBench、MBPP、LiveCodeBench、CodeContests和CodeForces五个基准上,CoVer在7B和14B规模分别较Qwen2.5-Instruct提升单次pass@1达5.8和7.1个百分点,并在两个规模上取得最高宏平均。作为CodeT排序流程的即插即用骨干,CoVer-7B额外提升3.5个百分点,表明协同训练对生成与选择两个环节均有增益。

🔑 关键词速览

CoVer本文提出的单策略 GRPO 框架,协同训练编码者与验证者,以提升代码生成的可靠性。
信息增益奖励 (IG reward)一种奖励机制,用测试的通过/失败向量与真实正确性信号之间的互信息来评分测试的区分能力。
宽松性崩溃 (permissiveness collapse)自博弈中通过率奖励被琐碎、非区分性测试最大化的失效模式。
集中偏差 (concentration bias)独立同分布采样的测试聚集在模态输入上,导致估计器方差增大的现象。
GRPO一种用于语言模型强化学习的策略优化算法,本文采用单策略 GRPO 框架。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅