arXiv cs.AI 发布于 08/26 12:00

Function-Level Execution Feedback for Code Preference Optimization

(翻译)函数级执行反馈用于代码偏好优化

查看原文

资讯摘要

Abstract page for arXiv paper 2608.23632: Function-Level Execution Feedback for Code Preference Optimization

AI 摘要

本文提出STEP-KTODER框架,将代码生成中的过程监督定义为多函数程序的模块级步骤,通过自动生成的单元测试为函数分配二进制正确性标签,并结合函数级过程监督与程序级结果反馈进行偏好优化。实验显示该方法在HumanEval、MBPP、BigCodeBench和LiveCodeBench上优于仅用结果级反馈的KTO与DPO,且执行标签比LLM判官标注更可靠。

AI 问答

STEP-KTODER 的核心思路是什么?

STEP-KTODER 将代码生成中的步骤定义为多函数程序里的模块级函数,并用自动生成的单元测试为每个函数分配二进制的正确性标签,从而结合函数级过程监督和程序级结果反馈进行偏好优化。

该方法的实验效果如何?

在 HumanEval(+)、MBPP(+)、BigCodeBench 和 LiveCodeBench 上,STEP-KTODER 相比仅使用结果级反馈的 KTO 和 DPO 均取得了更好的性能。

为什么执行标签比 LLM 判官更可靠?

研究发现,LLM-as-a-judge 的标注会系统性高估函数失败,污染正样本步骤标签并降低偏好优化效果,而基于执行的标签更加准确。

打开原文