PulseAugur
实时 08:24:35
实体 CodeBLEU

CodeBLEU

PulseAugur coverage of CodeBLEU — every cluster mentioning CodeBLEU across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_156383 ·

    新的128GB语料库和基准突显了LLM在科学代码生成方面的不足

    研究人员推出了SciCodePile,一个包含128GB科学代码的庞大语料库,以解决现有数据集在评估大型语言模型(LLM)生成科学代码能力方面的局限性。该语料库来自超过37,000个公共代码库,并附带一个包含200个任务的可执行基准,用于功能验证。对15个LLM的评估显示出显著的挑战,最好的模型在代码补全任务上的CodeBLEU得分仅为38.13%,在可执行代码生成任务上的Pass@1率仅为12.30%,这表明当前LLM与可靠的科学代…

  2. RESEARCH · CL_131293 ·

    新研究质疑 LLM 微调在 Dart 代码反编译中的有效性

    一篇新研究论文探讨了对大型语言模型进行微调以实现 Dart 预编译 (AOT) 二进制文件的神经反编译的有效性。研究发现,微调并未显著提高 pass@k 性能,在某些情况下甚至导致了性能回退。研究人员还观察到指标发散现象,例如 CodeBLEU 和 compile@k 指标有所改善,而 pass@k 指标却下降了,这表明微调可能更侧重于表面相似性而非功能正确性。该论文引入了 HumanEval-Dart 基准测试,并提倡将 pass@…

  3. RESEARCH · CL_08551 ·

    研究人员评估代码指标以检测软件抄袭

    一篇新研究论文调查了标准代码评估指标是否能有效检测源代码中的抄袭。该研究将五种指标——CodeBLEU、CrystalBLEU、RUBY、TSED 和 CodeBERTScore——与 JPlag 和 Dolos 等专业的抄袭检测工具进行了比较。结果表明,这些指标可以与专用工具相媲美,特别是经过预处理的 CrystalBLEU,并且在修改较少的代码上表现最佳。