一项发表在 arXiv 上的新研究调查了大型语言模型 (LLM) 修复代理中验证证据的可靠性。该研究引入了 BSG-VA 方法,通过在有缺陷的代码、候选状态和黄金修复上重放验证命令来分析验证命令。研究结果表明,很大一部分积极的验证事件缺乏区分错误的(bug-discriminating)信息,这意味着它们未能有效地测试报告的错误。向代理引入错误对比反馈(bug-contrast feedback)显示,不充分的修复(inadequate closures)有所减少,区分错误的证据有所增加,尽管这种改进的实际幅度仍不确定。 AI
影响 强调了 LLM 修复代理评估其修复的潜在缺陷,并提出了改进建议,以实现更可靠的自动化软件修复。
排序理由 关于 LLM 验证方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →