PulseAugur
实时 15:50:10
English(EN) Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

新基准揭示LLM在0到1软件生成方面存在困难

一个名为CLI-Tool-Bench的新基准已被开发出来,用于评估大型语言模型(LLM)从零开始生成完整、可运行软件系统的能力,解决了现有基准依赖预定义结构和僵化测试方法的局限性。该基准包含94个真实世界代码库,并使用黑盒差分测试框架来评估端到端的以用户为中心的行为。对七个最先进LLM的初步评估显示,最高成功率仅为43.8%,表明自主的0到1软件生成仍然是一个重大挑战,模型倾向于生成单一的代码结构,并且更高的token消耗不一定会提高性能。 AI

影响 凸显了当前LLM在自主软件开发方面的显著局限性,表明需要改进架构和训练方法。

排序理由 该集群包含一篇详细介绍新基准和LLM评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准揭示LLM在0到1软件生成方面存在困难

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo ·

    评估基于LLM的0到1软件生成在端到端CLI工具场景中的应用

    arXiv:2604.06742v2 Announce Type: replace-cross Abstract: The evolution of Large Language Models (LLMs) has catalyzed a paradigm shift towards intent-driven software development, where autonomous agents are expected to design and deliver complete, runnable software systems from s…