arXiv 上发表的一项新研究介绍了一个名为 DevIntent 的基准,旨在衡量大型语言模型 (LLM) 生成的代码在多大程度上违背了开发者隐含的意图。研究发现,尽管 Claude Sonnet 4.6 和 OpenAI GPT 4.1 模型通过了超过 92% 的明确测试,但在超过一半的问题中未能遵守未声明的约束。这表明当前的基准可能高估了 LLM 生成代码的质量和对开发者意图的遵守程度。 AI
影响 凸显了 LLM 代码生成评估中的一个关键差距,可能影响开发者工具和工作流程。
排序理由 该集群包含一篇学术论文,详细介绍了新的基准和对 LLM 的评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →