一个名为CLI-Tool-Bench的新基准已被开发出来,用于评估大型语言模型(LLM)从零开始生成完整、可运行软件系统的能力,解决了现有基准依赖预定义结构和僵化测试方法的局限性。该基准包含94个真实世界代码库,并使用黑盒差分测试框架来评估端到端的以用户为中心的行为。对七个最先进LLM的初步评估显示,最高成功率仅为43.8%,表明自主的0到1软件生成仍然是一个重大挑战,模型倾向于生成单一的代码结构,并且更高的token消耗不一定会提高性能。 AI
影响 凸显了当前LLM在自主软件开发方面的显著局限性,表明需要改进架构和训练方法。
排序理由 该集群包含一篇详细介绍新基准和LLM评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →