代码生成新突破!STEP-KTODER用函数级监督+自动测试,性能碾压DPO,还发现LLM评判员会误判函数失败!
Function-Level Execution Feedback for Code Preference Optimization
arXiv AI (cs.AI) 重要 论文方法代码生成 🕐 08-26 12:00

📖 AI 总结

本文提出STEP-KTODER框架,针对代码生成中过程监督缺乏标准步骤定义的问题,将多函数程序中的模块级函数视为步骤,并通过自动生成的单元测试为每个函数分配二元正确性标签。该方法将函数级过程监督与整体程序的结果级反馈结合,实现了逐步KTO的代码特化版本。在HumanEval(+)、MBPP(+)、BigCodeBench和LiveCodeBench等基准上的实验表明,STEP-KTODER优于仅使用结果反馈的KTO和DPO方法。进一步分析揭示,基于执行的标签至关重要:LLM作为评判者的标注系统性地高估函数失败,污染正向步骤标签,并降低下游偏好优化性能。该研究为代码生成中的过程监督提供了可行方案,验证了执行反馈在偏好优化中的核心价值。

🔑 关键词速览

STEP-KTODER提出的框架,将代码生成中的步骤定义为模块级函数,并结合函数级过程监督和结果级反馈进行偏好优化。
过程监督一种训练方法,通过提供中间步骤的反馈来指导模型,而不仅仅是最终结果。
KTO一种偏好优化算法,基于二元反馈(如正确/不正确)更新模型,无需成对比较。
DPO直接偏好优化,一种通过直接优化偏好目标来调整模型的方法,通常使用成对数据。
LLM-as-a-judge使用大型语言模型作为自动评估器来标注或评判生成内容的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅