PulseAugur
实时 07:12:37
English(EN) SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

新的128GB语料库和基准突显了LLM在科学代码生成方面的不足

研究人员推出了SciCodePile,一个包含128GB科学代码的庞大语料库,以解决现有数据集在评估大型语言模型(LLM)生成科学代码能力方面的局限性。该语料库来自超过37,000个公共代码库,并附带一个包含200个任务的可执行基准,用于功能验证。对15个LLM的评估显示出显著的挑战,最好的模型在代码补全任务上的CodeBLEU得分仅为38.13%,在可执行代码生成任务上的Pass@1率仅为12.30%,这表明当前LLM与可靠的科学代码生成之间存在相当大的差距。 AI

影响 强调了LLM在生成复杂科学代码方面的当前局限性,并指出了未来模型开发和训练的领域。

排序理由 该集群描述了一篇介绍用于评估LLM在科学代码生成方面的新数据集和基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的128GB语料库和基准突显了LLM在科学代码生成方面的不足

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo ·

    SciCodePile: 一个包含128GB语料库和可执行基准的科学代码生成挑战数据集

    arXiv:2607.19104v1 Announce Type: cross Abstract: Large language models (LLMs) excel at general-purpose code generation, yet how well they handle scientific code remains an open question. Existing datasets and benchmarks are limited in scale, domain coverage, or executable verifi…