一项分析用于自动程序修复(APR)的大型语言模型(LLM)中幻觉的新研究揭示了重大问题。研究人员检查了三个LLM在832个Defects4J错误上的表现,发现只有21.0%-55.9%生成的补丁通过了开发人员编写的测试套件。研究确定在72.7%的分析案例中存在修复幻觉,其中不正确的定位和修复策略是常见原因。此外,LLM经常错误地识别触发测试用例并错误地预测行覆盖率。 AI
影响 强调了LLM驱动的代码修复中的关键局限性,表明需要改进幻觉检测和缓解策略。
排序理由 学术论文,详细介绍了关于LLM在自动程序修复中幻觉的研究。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →