研究人员推出了一种名为STEP-KTODER的新型框架,旨在通过函数级过程监督来增强代码生成模型。该方法将“步骤”定义为分解程序中的模块级函数,并利用自动生成的单元测试来分配二进制正确性标签。通过结合函数级监督和结果级反馈,STEP-KTODER旨在改进现有的方法,如直接偏好优化(DPO)和仅结果的KTO。在HumanEval(+)和MBPP(+)等基准上的评估证明了STEP-KTODER的有效性,并强调了基于执行的标签相对于会降低性能的LLM-as-a-judge注释的关键作用。 AI
影响 这项研究通过改进AI代码生成模型从中间执行反馈中学习的方式,可能带来更强大、更准确的AI代码生成模型。
排序理由 关于代码生成优化新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- BigCodeBench
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Direct Preference Optimization
- Gotit.pub
- Hugging Face
- Influence Flower
- LiveCodeBench
- ScienceCast
- STEP-KTODER
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →