ProgramBench
PulseAugur coverage of ProgramBench — every cluster mentioning ProgramBench across labs, papers, and developer communities, ranked by signal.
-
新框架赋能 LLM 代理自主开发和改进软件
研究人员推出 Harness-of-Harness (HoH) 框架,旨在通过使基于 LLM 的编码代理能够持续改进软件来增强自主软件开发能力。HoH 将开发过程结构化为迭代的规划-编码-测试循环,平衡修复与能力增长,并将任务分解为小型、可验证的增量。在 GameCraft-Bench、FrontierSWE 和 ProgramBench 等基准测试中,HoH 表现出显著的性能提升,平均比独立 harness 提高了 52.25%。在…
-
Anthropic 的 Opus 5 在 ProgramBench 上设定新的 SoTA,击败 GPT Sol
Anthropic 的 Opus 5 模型在 ProgramBench 基准测试中取得了新的最先进性能,成功解决了 200 个任务实例中的 9 个。这比之前的最佳模型 GPT Sol 提高了四倍多。在这一基准上评估 Opus 5 的成本相当高,花费了 10,000 美元。
-
MindForge 管道训练小型 LLM 完成软件工程全生命周期
研究人员开发了 MindForge,这是一个旨在训练小型语言模型执行全面软件工程任务的自动化管道。该系统将开源命令行程序转换为无源代码的训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成程序轨迹上微调 Qwen3.6-27B 模型,研究人员显著提高了其在 ProgramBench 基准测试上的性能,取得了与大型前沿模型相当的结果。微调后的模型在各种未见过的软件工程任务中也表现出广泛的改进,包括代码生成、错误修…
-
Moonshot AI 发布开源 Kimi K3,用于复杂的编码任务 · 跟踪 2 个来源
Moonshot AI 发布了 Kimi K3,这是一个拥有 2.8 万亿参数的开源模型,专为长时程编码和代理任务而设计。该模型具有一百万个 token 的上下文窗口和混合专家(Mixture-of-Experts)架构,使其能够处理和理解庞大的代码库。虽然供应商报告的基准测试显示其编码性能具有竞争力,但其真正的价值在于其开源权重,允许团队将其集成到自己的工作流程中,并尝试自定义工具和系统。
-
Fable 5 基准测试显示性能是 Opus 4.8 的两倍
一项新的基准测试 ProgramBench 已用于评估 Fable 5,结果表明其性能显著优于 Opus 4.8。基准测试的创建者指出,即使 Fable 5 在某些任务中使用了回退机制至 Opus 4.8,其性能仍是 Opus 4.8 的两倍。一个有趣的观察是,Fable 5 中回退到 Opus 4.8 所消耗的 token 是 Opus 4.8 单独执行类似任务的两倍。
-
ProgramBench 编码基准因不可能的未记录测试而使前沿模型失败
一个名为 ProgramBench 的新编码基准旨在评估前沿人工智能模型,但因其可能无法解决而受到批评。该基准要求模型根据有限的文档重新实现程序并通过一套单元测试,其中一些可能涵盖未记录或晦涩的功能。这种设计可能导致模型因发现隐藏行为或后门而失败,而不是因为缺乏编码智能,这促使人们建议进行改进,例如下游测试和加权评分。
-
ProgramBench基准测试发现语言模型难以从头开始构建软件
研究人员推出了ProgramBench,这是一个旨在评估语言模型整体软件开发能力的新基准。该基准挑战AI代理仅根据程序文档,从头开始构建和实现整个代码库。在包括FFmpeg和SQLite等软件实现的200项任务中,接受评估的九个语言模型均未能完全完成任何一项任务,表现最好的模型平均仅通过3%的测试。