🔥 今日值得一读 代码生成测试时强化学习失效?探针驱动TTRL+ERPO让pass@1暴涨!
Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation
arXiv CL (cs.CL) 🔥 重点 #代码生成#强化学习#测试时训练 🕐 09-08 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法在测试时通过探针输入执行候选程序,基于行为共识奖励优化代码生成模型,无需标注答案。

📖 摘要

提出探针驱动的测试时强化学习,用行为共识奖励提升代码生成性能。

🔑 关键词速览

Test-Time Reinforcement Learning (TTRL)测试时强化学习,一种在推理阶段利用未标记测试任务进行策略优化的方法。
Probe Consensus Reward (PCR)探针共识奖励,通过执行候选程序于探针输入并比较行为一致性来生成的奖励信号。
Entropy-Regularized Rank-Masked Policy Optimization (ERPO)熵正则化排名掩码策略优化,一种通过排名掩码和熵上限来防止奖励黑客并稳定策略更新的优化算法。
Reward Hacking奖励黑客,指模型利用奖励函数的漏洞获得高奖励但未真正完成任务的现象。
pass@k一种代码生成评估指标,表示在k次生成中至少有一次通过测试的概率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅