一个名为PRAXIST 的开源AI研究系统在MLE-bench上取得了比 Claude Code 基线更优异的结果。PRAXIST 以约3000美元的计算成本获得了49枚金牌,而 Claude Code 基线则以38000美元的成本获得了34枚金牌。该系统的成功归因于其继承失败实验证据而非仅仅分数的方法,从而将经验教训传递给后续的迭代。 AI
影响 展示了一种新颖的AI研究方法,该方法显著降低了计算成本,同时提高了性能,可能影响未来的AI开发方法。
排序理由 该条目描述了一个研究系统在基准测试上的表现,详细说明了其方法和结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →