STEP-KTODER 的核心思路是什么?
STEP-KTODER 将代码生成中的步骤定义为多函数程序里的模块级函数,并用自动生成的单元测试为每个函数分配二进制的正确性标签,从而结合函数级过程监督和程序级结果反馈进行偏好优化。
(翻译)函数级执行反馈用于代码偏好优化
Abstract page for arXiv paper 2608.23632: Function-Level Execution Feedback for Code Preference Optimization
本文提出STEP-KTODER框架,将代码生成中的过程监督定义为多函数程序的模块级步骤,通过自动生成的单元测试为函数分配二进制正确性标签,并结合函数级过程监督与程序级结果反馈进行偏好优化。实验显示该方法在HumanEval、MBPP、BigCodeBench和LiveCodeBench上优于仅用结果级反馈的KTO与DPO,且执行标签比LLM判官标注更可靠。
STEP-KTODER 将代码生成中的步骤定义为多函数程序里的模块级函数,并用自动生成的单元测试为每个函数分配二进制的正确性标签,从而结合函数级过程监督和程序级结果反馈进行偏好优化。
在 HumanEval(+)、MBPP(+)、BigCodeBench 和 LiveCodeBench 上,STEP-KTODER 相比仅使用结果级反馈的 KTO 和 DPO 均取得了更好的性能。
研究发现,LLM-as-a-judge 的标注会系统性高估函数失败,污染正样本步骤标签并降低偏好优化效果,而基于执行的标签更加准确。
黄仁勋为微软站台:没有 Windows 就不会有英伟达,Satya 当场“讨市值”国铁广州局明起实施新列车运行图,多条列车首次开行成年人要的「安心」,有时是一支笔给的当所有人都用AI写内容,你的个人IP靠什么胜出?全国性涉外法律服务平台“法通”网正式上线超强厄尔尼诺已经形成纯炒作?那为什么只有 Muse 爆了世界的下一个版本,由我们定义 |2026苏客松招募启动泰国证交所修订卖空和高频交易规则第三季度21家上市银行获511家机构调研
@ 一下就能派活?谷歌推出办公 Agent,拥有独立账号、能够创建子 Agent,还能调用 Claude深港“全天候通道”升级 新皇岗口岸5分钟便捷通关紧急调研刹车踏板总成材质!曝中汽中心向各大车企发问卷;山姆拟限制亲友卡绑定,打击倒卖副卡;又涨1000元!华为和小米同日上调手机售价AI数据中心用电狂飙,美国密西西比州发出电力预警得中女得天下?这个年销3亿的女装品牌AAAD给出了新答案!公司是否有提价计划?五粮液:不存在固定的价格比值关系三峡水运新通道葛洲坝航运扩能主体工程开工Linear 通过 1000 多次 PR 从 styled-components 迁移到 Meta 的 StyleX
大模型通用答案没有考虑每个人需求食言?微信小程序Store上线新模型密集发布,该怎么选?分享我的实测感受江淮汽车增资至约22.54亿