arXiv上发表的一项新研究探讨了大型语言模型(LLMs)在自动验证无代码错误修复方面的有效性。该研究提出了一个基于执行的管道,以评估LLMs在真实浏览器环境中生成和验证这些修复的能力。结果表明,虽然LLMs可以生成修复,但其解决率因所使用的执行器代理而异,其中Claude Opus 4.6和Claude Sonnet 5表现出有希望但并不完美。 AI
影响 基于LLM的无代码修复验证可以通过减少手动开发人员的努力来简化软件开发。
排序理由 研究论文,详细介绍了一种评估LLM能力的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →