研究人员推出了SciCodePile,一个包含128GB科学代码的庞大语料库,以解决现有数据集在评估大型语言模型(LLM)生成科学代码能力方面的局限性。该语料库来自超过37,000个公共代码库,并附带一个包含200个任务的可执行基准,用于功能验证。对15个LLM的评估显示出显著的挑战,最好的模型在代码补全任务上的CodeBLEU得分仅为38.13%,在可执行代码生成任务上的Pass@1率仅为12.30%,这表明当前LLM与可靠的科学代码生成之间存在相当大的差距。 AI
影响 强调了LLM在生成复杂科学代码方面的当前局限性,并指出了未来模型开发和训练的领域。
排序理由 该集群描述了一篇介绍用于评估LLM在科学代码生成方面的新数据集和基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →