PulseAugur
实时 08:57:50
English(EN) DevIntent: How Much Does LLM-Generated Code Violate Developer Intent?

研究发现:LLM 生成的代码未能满足开发者的意图

arXiv 上发表的一项新研究介绍了一个名为 DevIntent 的基准,旨在衡量大型语言模型 (LLM) 生成的代码在多大程度上违背了开发者隐含的意图。研究发现,尽管 Claude Sonnet 4.6OpenAI GPT 4.1 模型通过了超过 92% 的明确测试,但在超过一半的问题中未能遵守未声明的约束。这表明当前的基准可能高估了 LLM 生成代码的质量和对开发者意图的遵守程度。 AI

影响 凸显了 LLM 代码生成评估中的一个关键差距,可能影响开发者工具和工作流程。

排序理由 该集群包含一篇学术论文,详细介绍了新的基准和对 LLM 的评估。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现:LLM 生成的代码未能满足开发者的意图

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Susana Haing, Natan Vidra, Spurthi Setty ·

    DevIntent:LLM 生成的代码在多大程度上违背了开发者的意图?

    arXiv:2608.07614v1 Announce Type: cross Abstract: Code generated by LLMs can violate a developer's implicit intentions when given an ambiguous prompt, yet standard benchmarks measure only whether code passes its stated test. We introduce the Intent Violation Rate (IVR) and a 49-p…