PulseAugur
实时 08:10:17
实体 ProgramBench

ProgramBench

PulseAugur coverage of ProgramBench — every cluster mentioning ProgramBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_171855 ·

    MindForge 管道训练小型 LLM 进行全周期软件工程

    研究人员开发了 MindForge,一个旨在训练小型语言模型进行全面软件工程任务的新型管道。该系统将开源命令行程序转换为无源码训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成数据上微调 Qwen3.6-27B 模型,研究人员显著提高了其生成完整程序的能力,达到了与更大规模前沿模型相当的性能水平。

  2. TOOL · CL_94988 ·

    Fable 5 基准测试显示性能是 Opus 4.8 的两倍

    一项新的基准测试 ProgramBench 已用于评估 Fable 5,结果表明其性能显著优于 Opus 4.8。基准测试的创建者指出,即使 Fable 5 在某些任务中使用了回退机制至 Opus 4.8,其性能仍是 Opus 4.8 的两倍。一个有趣的观察是,Fable 5 中回退到 Opus 4.8 所消耗的 token 是 Opus 4.8 单独执行类似任务的两倍。

  3. RESEARCH · CL_23515 ·

    ProgramBench 编码基准因不可能的未记录测试而使前沿模型失败

    一个名为 ProgramBench 的新编码基准旨在评估前沿人工智能模型,但因其可能无法解决而受到批评。该基准要求模型根据有限的文档重新实现程序并通过一套单元测试,其中一些可能涵盖未记录或晦涩的功能。这种设计可能导致模型因发现隐藏行为或后门而失败,而不是因为缺乏编码智能,这促使人们建议进行改进,例如下游测试和加权评分。

  4. RESEARCH · CL_18314 ·

    ProgramBench基准测试发现语言模型难以从头开始构建软件

    研究人员推出了ProgramBench,这是一个旨在评估语言模型整体软件开发能力的新基准。该基准挑战AI代理仅根据程序文档,从头开始构建和实现整个代码库。在包括FFmpeg和SQLite等软件实现的200项任务中,接受评估的九个语言模型均未能完全完成任何一项任务,表现最好的模型平均仅通过3%的测试。