本文提出STEP-KTODER框架,针对代码生成中过程监督缺乏标准步骤定义的问题,将多函数程序中的模块级函数视为步骤,并通过自动生成的单元测试为每个函数分配二元正确性标签。该方法将函数级过程监督与整体程序的结果级反馈结合,实现了逐步KTO的代码特化版本。在HumanEval(+)、MBPP(+)、BigCodeBench和LiveCodeBench等基准上的实验表明,STEP-KTODER优于仅使用结果反馈的KTO和DPO方法。进一步分析揭示,基于执行的标签至关重要:LLM作为评判者的标注系统性地高估函数失败,污染正向步骤标签,并降低下游偏好优化性能。该研究为代码生成中的过程监督提供了可行方案,验证了执行反馈在偏好优化中的核心价值。
| STEP-KTODER | 提出的框架,将代码生成中的步骤定义为模块级函数,并结合函数级过程监督和结果级反馈进行偏好优化。 |
| 过程监督 | 一种训练方法,通过提供中间步骤的反馈来指导模型,而不仅仅是最终结果。 |
| KTO | 一种偏好优化算法,基于二元反馈(如正确/不正确)更新模型,无需成对比较。 |
| DPO | 直接偏好优化,一种通过直接优化偏好目标来调整模型的方法,通常使用成对数据。 |
| LLM-as-a-judge | 使用大型语言模型作为自动评估器来标注或评判生成内容的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅