研究人员引入了精确调试基准(PDB)框架来评估大型语言模型的调试能力。该框架将现有的编码数据集转换为调试基准,通过合成的原子级错误自动生成有缺陷的程序。PDB采用编辑级精确率和错误级召回率等新颖指标来评估模型修复代码的准确性。实验显示,像GPT-5.1-Codex和DeepSeek-V3.2-Thinking等领先模型,尽管测试通过率很高,但在精确度方面仍有困难,经常过度编辑解决方案。 AI
影响 突显了当前大型语言模型编码能力中的一个差距,表明需要新的训练后方法来提高精确调试能力。
排序理由 一项介绍大型语言模型调试能力的基准和评估指标的新学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →