一项发表在arXiv上的新研究调查了基于大型语言模型(LLM)的自动化程序修复(APR)技术的有效性。该研究分析了错误复杂性、故障定位准确性以及不同LLM的成本等因素如何影响修复性能。研究结果表明,尽管复杂错误和不精确的故障定位带来了挑战,但基于LLM的APR仍然具有竞争力,尽管成本更高的模型并不总是提供更好的成本效益。具体而言,GPT-5在修复复杂错误方面优于DeepSeek V4-Pro和DeepSeek V3.2,但DeepSeek V3.2表现出更优越的成本效益。 AI
影响 为优化LLM在软件开发任务中的使用提供了见解,强调了成本效益的权衡。
排序理由 研究论文分析LLM在自动化程序修复上的性能。[lever_c_demoted from research: ic=1 ai=1.0]
- ChatRepair
- CodeCorrector
- DeepSeek
- DeepSeek V3.2
- DeepSeek V4-Pro
- generative pre-trained transformer
- GPT-5
- llama
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →