研究人员推出了ProgramBench,这是一个旨在评估语言模型整体软件开发能力的新基准。该基准挑战AI代理仅根据程序文档,从头开始构建和实现整个代码库。在包括FFmpeg和SQLite等软件实现的200项任务中,接受评估的九个语言模型均未能完全完成任何一项任务,表现最好的模型平均仅通过3%的测试。 AI
影响 凸显了当前大型语言模型在复杂软件工程任务中的局限性,表明需要进一步研究以实现自主代码生成。
排序理由 这是一篇介绍用于评估语言模型在软件开发中表现的新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →