PulseAugur
实时 09:54:47
English(EN) Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

新研究量化了 LLM 在错误代码测试生成中的误导作用

一篇新论文介绍了一种量化“误导效应”的指标,即错误代码会提示大型语言模型(LLM)生成验证错误行为而非暴露错误的单元测试。这种效应会导致更多误导性的测试和更少的有效发现错误的测试。为解决此问题,研究人员提出了一种基于规范的单元测试生成方法,该方法在提示中使用生成的规范文档字符串而非错误代码,从而有效减少了误导性测试并改进了测试生成流程。 AI

影响 这项研究可以提高 LLM 生成代码的可靠性,从而带来更健壮的软件开发实践。

排序理由 该集群包含一篇学术论文,详细介绍了用于评估 LLM 生成的单元测试的新指标和方法论。[lever_c_demoted from research: ic=1 ai=1.0]

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新研究量化了 LLM 在错误代码测试生成中的误导作用

报道来源 [1]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    评估和缓解LLM生成单元测试中错误代码的误导效应

    While Large Language Models (LLMs) show great promise for automating unit test generation, recent studies suggest that the quality of generated tests can be negatively impacted when models are prompted with buggy code. This paper presents a new metric to quantitatively measure th…