PulseAugur
实时 11:39:56
实体 CLI-Tool-Bench

CLI-Tool-Bench

PulseAugur coverage of CLI-Tool-Bench — every cluster mentioning CLI-Tool-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_151942 ·

    新基准揭示LLM在0到1软件生成方面存在困难

    一个名为CLI-Tool-Bench的新基准已被开发出来,用于评估大型语言模型(LLM)从零开始生成完整、可运行软件系统的能力,解决了现有基准依赖预定义结构和僵化测试方法的局限性。该基准包含94个真实世界代码库,并使用黑盒差分测试框架来评估端到端的以用户为中心的行为。对七个最先进LLM的初步评估显示,最高成功率仅为43.8%,表明自主的0到1软件生成仍然是一个重大挑战,模型倾向于生成单一的代码结构,并且更高的token消耗不一定会提高性能。