PulseAugur
实时 10:07:19
English(EN) Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study)

研究发现 LLM 测试生成的有效性取决于代码上下文

arXiv 上的一项最新研究调查了 LLM 生成的测试套件的有效性,特别检查了代码覆盖率、变异分数和真实错误检测之间的相关性。研究发现,这些指标的效用高度依赖于上下文,在假定输入代码无错误的回归式场景中表现更好。相比之下,当被测代码已存在错误时,覆盖率和变异分数就成为不可靠的指标。研究还表明,对于 LLM 生成的测试,测试套件的大小并不是混淆这些相关性的主要因素。 AI

影响 为解释和应用 LLM 生成测试的代码覆盖率和变异分数提供了指导,影响软件开发实践。

排序理由 该项目是一篇发表在 arXiv 上的研究论文,讨论了 LLM 生成的测试套件。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现 LLM 测试生成的有效性取决于代码上下文

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Junda Zhao, Shurui Zhou, Eldan Cohen ·

    Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study)

    arXiv:2607.22880v1 Announce Type: cross Abstract: Recent advances in large language models (LLMs) have driven growing interest in using LLMs to automate test generation. Prior work commonly evaluates generated test suites using proxy metrics such as code coverage and mutation sco…