PulseAugur
实时 13:38:33
实体 SWE-rebench

SWE-rebench

PulseAugur coverage of SWE-rebench — every cluster mentioning SWE-rebench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
时间线
  1. 2026-07-01 research_milestone The SWE-rebench leaderboard was updated with new models and an improved UI for comparing AI performance on coding tasks. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_169015 ·

    SWE-rebench 新增多语言编码任务,GLM-5.2 领跑排行榜

    SWE-rebench 排行榜已更新,新增了一个多语言测试集,涵盖五种编程语言的软件工程任务:Go、Java、Python、Rust 和 TypeScript。此次更新包含了多个开源模型的性能指标,其中 GLM-5.2 的 Pass@1 分数最高,达到 62.9%。该项目计划在 3-4 周内进行另一次更新,重点关注适合本地部署的模型,并征集社区对未来评估的建议。

  2. TOOL · CL_120598 ·

    SWE-rebench 排行榜新增 Claude Opus 4.8、GLM-5.2、Gemini 3.5 Flash

    SWE-rebench 排行榜已更新,新增了模型并改进了用户界面,使得在编码任务上比较 AI 性能更加容易。值得注意的新增模型包括 Claude Opus 4.8 xhigh、GLM-5.2 和 Gemini 3.5 Flash,以及多个 Qwen 和 DeepSeek 模型。此次更新还突出了本地和自托管模型的测试结果,鼓励社区就接下来要测试哪些模型提供意见。

  3. TOOL · CL_99352 ·

    校准后的 2 位 GGUF 模型在 SWE-rebench 上通过率达到 63%

    开发了一种新的方法来校准 2 位量化语言模型,特别是 10GB 以下的 GGUF 格式,以用于代理编码任务。这些经过校准的模型,例如 Qwopus3.6-27B-Coder,在 SWE-rebench 基准测试上的通过率超过 60%。校准过程利用真实的代理编码日志和重要性矩阵,在显著减小模型尺寸和提高解码速度的同时保持性能。

  4. TOOL · CL_55071 ·

    SWE-rebench 排行榜新增 110 个面向 AI 模型的 Python 任务

    SWE-rebench 排行榜已更新,新增了来自 GitHub PR 的 110 个 Python 任务,涵盖 3 月、4 月和 5 月。此次更新侧重于评估模型阅读真实问题、编辑代码和通过测试套件的能力。未来的更新将包括更多模型,如 Gemini Flash 3.5 和 DeepSeek v4 Pro,以及多语言任务和本地开发选项。