提出探针驱动的测试时强化学习,用行为共识奖励提升代码生成性能。
| Test-Time Reinforcement Learning (TTRL) | 测试时强化学习,一种在推理阶段利用未标记测试任务进行策略优化的方法。 |
| Probe Consensus Reward (PCR) | 探针共识奖励,通过执行候选程序于探针输入并比较行为一致性来生成的奖励信号。 |
| Entropy-Regularized Rank-Masked Policy Optimization (ERPO) | 熵正则化排名掩码策略优化,一种通过排名掩码和熵上限来防止奖励黑客并稳定策略更新的优化算法。 |
| Reward Hacking | 奖励黑客,指模型利用奖励函数的漏洞获得高奖励但未真正完成任务的现象。 |
| pass@k | 一种代码生成评估指标,表示在k次生成中至少有一次通过测试的概率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅