PulseAugur
实时 12:50:46
English(EN) SWE-rebench Multilingual Update (Go, Java, Python, Rust, TS). Evaluated: GLM-5.2, DeepSeek-V4 Pro, Qwen3.6-27B and others

SWE-rebench 新增多语言编码任务,GLM-5.2 领跑排行榜

SWE-rebench 排行榜已更新,新增了一个多语言测试集,涵盖五种编程语言的软件工程任务:Go、JavaPythonRustTypeScript。此次更新包含了多个开源模型的性能指标,其中 GLM-5.2 的 Pass@1 分数最高,达到 62.9%。该项目计划在 3-4 周内进行另一次更新,重点关注适合本地部署的模型,并征集社区对未来评估的建议。 AI

影响 此次更新将 AI 模型评估扩展到多种编程语言,提供了对 Python 以外编码能力的更全面视角。

排序理由 该条目报告了用于评估 AI 模型在软件工程任务上表现的基准排行榜的更新。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

SWE-rebench 新增多语言编码任务,GLM-5.2 领跑排行榜

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Fabulous_Pollution10 ·

    SWE-rebench 多语言更新 (Go, Java, Python, Rust, TS)。评估:GLM-5.2, DeepSeek-V4 Pro, Qwen3.6-27B 等

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1v93phk/swerebench_multilingual_update_go_java_python/"> <img alt="SWE-rebench Multilingual Update (Go, Java, Python, Rust, TS). Evaluated: GLM-5.2, DeepSeek-V4 Pro, Qwen3.6-27B and others" src="https://extern…