SWE-rebench 排行榜已更新,新增了一个多语言测试集,涵盖五种编程语言的软件工程任务:Go、Java、Python、Rust 和 TypeScript。此次更新包含了多个开源模型的性能指标,其中 GLM-5.2 的 Pass@1 分数最高,达到 62.9%。该项目计划在 3-4 周内进行另一次更新,重点关注适合本地部署的模型,并征集社区对未来评估的建议。 AI
影响 此次更新将 AI 模型评估扩展到多种编程语言,提供了对 Python 以外编码能力的更全面视角。
排序理由 该条目报告了用于评估 AI 模型在软件工程任务上表现的基准排行榜的更新。[lever_c_demoted from research: ic=1 ai=1.0]
- DeepSeek V4-Pro
- GLM-5.2
- Java
- MiMo V2.5 Pro
- MiniMax M3
- Python
- Qwen3.5-35B-A3B
- Qwen3.6-27B
- Qwen3.6-35B-A3B
- Rust
- SWE-rebench
- TypeScript
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →