arXiv 上的一项最新研究调查了 LLM 生成的测试套件的有效性,特别检查了代码覆盖率、变异分数和真实错误检测之间的相关性。研究发现,这些指标的效用高度依赖于上下文,在假定输入代码无错误的回归式场景中表现更好。相比之下,当被测代码已存在错误时,覆盖率和变异分数就成为不可靠的指标。研究还表明,对于 LLM 生成的测试,测试套件的大小并不是混淆这些相关性的主要因素。 AI
影响 为解释和应用 LLM 生成测试的代码覆盖率和变异分数提供了指导,影响软件开发实践。
排序理由 该项目是一篇发表在 arXiv 上的研究论文,讨论了 LLM 生成的测试套件。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Inozemtseva et al.
- Papadakis et al.
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →