研究人员开发了 HealBench,这是一个旨在评估大型语言模型 (LLM) 在真实软件代码库中自动修复运行时错误的有效性和安全性新基准。该系统包括 HealGuard,一种使用静态和动态污点分析的安全机制,以确保 LLM 生成的代码不会损害受保护的操作。在评估中,表现最佳的 LLM 设置在 38.11% 的实例中成功恢复了执行,并在 28.68% 的情况下通过了目标测试,尽管 HealGuard 标记了其中很大一部分可能不安全。 AI
影响 这项研究提高了 LLM 在自动代码修复方面的安全性与可靠性,有望实现更强大的软件开发工具。
排序理由 该项目是一篇研究论文,介绍了一个用于基于 LLM 的软件错误修复的新基准和安全机制。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- HealBench
- HealCore
- HealGuard
- Hugging Face
- Python
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →