实体
buggy code
buggy code
PulseAugur coverage of buggy code — every cluster mentioning buggy code across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新指标量化 LLM 在单元测试中受错误代码的误导
一篇新论文介绍了一种量化“误导效应”的指标,即错误代码会诱导大型语言模型(LLM)生成验证不正确行为而非暴露不正确行为的单元测试。这种效应会导致更多误导性的测试和更少的有效测试。为了解决这个问题,研究人员提出了一种基于规范的提示方法,该方法使用 LLM 生成的文档字符串而不是错误代码本身,从而显著提高了对错误代码和无错误代码的测试生成。
-
新研究量化了 LLM 在错误代码测试生成中的误导作用
一篇新论文介绍了一种量化“误导效应”的指标,即错误代码会提示大型语言模型(LLM)生成验证错误行为而非暴露错误的单元测试。这种效应会导致更多误导性的测试和更少的有效发现错误的测试。为解决此问题,研究人员提出了一种基于规范的单元测试生成方法,该方法在提示中使用生成的规范文档字符串而非错误代码,从而有效减少了误导性测试并改进了测试生成流程。