PulseAugur
实时 07:48:47
English(EN) Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

研究质疑 LLM 修复代理验证证据的可靠性

一项发表在 arXiv 上的新研究调查了大型语言模型 (LLM) 修复代理中验证证据的可靠性。该研究引入了 BSG-VA 方法,通过在有缺陷的代码、候选状态和黄金修复上重放验证命令来分析验证命令。研究结果表明,很大一部分积极的验证事件缺乏区分错误的(bug-discriminating)信息,这意味着它们未能有效地测试报告的错误。向代理引入错误对比反馈(bug-contrast feedback)显示,不充分的修复(inadequate closures)有所减少,区分错误的证据有所增加,尽管这种改进的实际幅度仍不确定。 AI

影响 强调了 LLM 修复代理评估其修复的潜在缺陷,并提出了改进建议,以实现更可靠的自动化软件修复。

排序理由 关于 LLM 验证方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究质疑 LLM 修复代理验证证据的可靠性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Xiaonan Xu, Wenjing Wu ·

    LLM 修复代理中的验证证据:有多少通过的真正测试了错误?

    arXiv:2607.28871v1 Announce Type: cross Abstract: When a repair agent runs a test and sees it pass, the result is treated as evidence about the reported defect. We measure how often that treatment is warranted. BSG-VA (buggy-state/candidate-state/gold-fix validation analysis) cap…