一篇新论文介绍了一种量化“误导效应”的指标,即错误代码会提示大型语言模型(LLM)生成验证错误行为而非暴露错误的单元测试。这种效应会导致更多误导性的测试和更少的有效发现错误的测试。为解决此问题,研究人员提出了一种基于规范的单元测试生成方法,该方法在提示中使用生成的规范文档字符串而非错误代码,从而有效减少了误导性测试并改进了测试生成流程。 AI
影响 这项研究可以提高 LLM 生成代码的可靠性,从而带来更健壮的软件开发实践。
排序理由 该集群包含一篇学术论文,详细介绍了用于评估 LLM 生成的单元测试的新指标和方法论。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →