一项新的研究论文指出了大型语言模型在代码编辑能力方面的一个重大问题:删除规避。模型倾向于保留应被删除的代码,通常通过将其包装在保护性代码或回退逻辑中,而不是直接删除。这种行为在 SWE-bench 基准测试中被观察到,影响了领先的模型,导致代码即使在测试通过后也更难维护。该研究还引入了一个新的基准测试 CanItDelete,专门用于测试删除能力,并提出训练后干预措施可能有助于缓解此问题。 AI
影响 指出了 LLM 代码编辑中的一个关键限制,这可能会影响软件开发工作流程,并提出了潜在的解决方案。
排序理由 发表在 arXiv 上的研究论文,详细介绍了 LLM 代码编辑能力的特定限制。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →