SWE Bench Pro
PulseAugur coverage of SWE Bench Pro — every cluster mentioning SWE Bench Pro across labs, papers, and developer communities, ranked by signal.
- instance of Claude (Opus 4.8) 90%
- used by GLM-5.2 90%
- instance of Opus 4.8 90%
- instance of Terminal-Bench 2.1 90%
- instance of Zhipu AI 90%
- instance of Claude Fable-5 90%
- instance of Terminal-Bench 90%
- instance of Terminal Bench 2.0 90%
- instance of MAI-Thinking 1 90%
- instance of MAI-Code-1-Flash 90%
- instance of cubic metre 90%
- used by Minimax 90%
9 天有情绪数据
Anthropic's focus on 'abstention' in Opus 4.8 will drive adoption for critical coding tasks
Opus 4.8's improved ability to abstain from answering when uncertain, rather than providing incorrect information, is a critical feature for complex coding tasks. This trait, highlighted in recent evidence, could lead to increased adoption of Claude Opus for high-stakes software development where accuracy and reliability are paramount.
SWE-Bench Pro scores are rapidly increasing, with multiple models surpassing 50%
Recent evidence shows MiniMax's M3 model achieving 59% and Microsoft's MAI-Code-1-Flash achieving 51% on SWE-Bench Pro. This indicates a significant upward trend in AI coding benchmark performance, with several models now breaking the 50% barrier.
MiniMax M3 may become a leading open-source alternative for coding tasks
MiniMax's M3 model has demonstrated strong performance on SWE-Bench Pro (59%) and Terminal Bench 2 (66%), coupled with a 1M token context window. If its accessibility and performance remain competitive, it could emerge as a preferred open-source option for developers seeking advanced coding assistance, potentially challenging proprietary models.
-
LLM 生产就绪性需要超越基准测试的 10 项测试
一份 2026 年的 LLM 评估清单强调,要超越简单的基准分数,进行全面的生产就绪性测试。Quokka Labs 开发的这种方法侧重于评估整个 AI 系统,包括其数据检索、工具、护栏和失败路径,而不仅仅是模型固有的能力。关键测试包括从实际工作中构建黄金数据集、衡量任务成功率而非写作质量、区分幻觉和 RAG 基础评估、打破输出合同以及进行安全和策略边界的红队测试。
-
Qwen3.8-27B开源模型凭借先进的智能体能力登顶排行榜
阿里巴巴的Qwen团队已开源Qwen3.8-27B,这是一个拥有270亿参数的模型,在包括SWE Bench Pro和OSWorld在内的多个基准测试中取得了顶级排名。该模型在智能体能力方面展现出显著的进步,例如规划和多步任务完成,其表现优于更大的模型甚至云端旗舰模型。其架构融合了线性和全注意力层的创新组合,以高效处理长上下文,并为用户提供可控的“思考”模式。该模型的跨模态训练使其能够有效地在桌面、浏览器和移动设备等各种界面上运行。
-
九章智算云聚焦AI基础设施的训练推理一致性
九章智算云正在开发一个专注于“训练推理一致性”的AI基础设施系统,以支持日益增长的对强化学习(RL)以扩展模型能力的需求。该系统旨在高效管理模型的持续生成、训练和更新,超越简单的“模型+算力”范式。通过集成生成器、环境和训练器等组件,并优化它们之间的动态匹配,九章智算云力求降低成本并提高有效token的产出和模型性能。
-
阿里巴巴 Qwen 3.8-27B 模型在 SWE-Bench Pro 上超越 Claude Opus 4.6 Max
阿里巴巴新款开源模型 Qwen 3.8-27B 在 SWE-Bench Pro 基准测试中表现优于 Anthropic 的 Claude Opus 4.6 Max,得分分别为 61.7 和 53.4。这款拥有 270 亿参数的模型能够运行在单块 24GB GPU 上,并支持 262,000 个 token 的原生上下文窗口。Qwen 3.8-27B 以 Apache 2.0 许可证发布。
-
Qwen3.8-27B 开源模型在基准测试中可与 Claude Opus 相媲美
Qwen 发布了其 Qwen3.8-27B 模型,这是一个开源模型,在各种基准测试中,尤其是在编码和代理任务方面,其性能可与 Claude Opus 4.6 Max 等更大、专有的模型相媲美。这个拥有 270 亿参数的模型设计用于在消费级 GPU 上运行,提供 262K 的原生上下文窗口,可扩展至 100 万个 token。它还具有原生多模态能力,能够处理图像、PDF 甚至视频,并具有可定制的推理深度以提高效率。
-
Sonnet 5 在 SWE-bench Pro 上达到 63.2%;OpenAI 的 Terra 声称的基准分数未经证实
一款新的人工智能模型 Sonnet 5 在 SWE-bench Pro 基准测试中取得了 63.2% 的分数。另外,OpenAI 的模型 Terra 据称在 Terminal-Bench 上获得了 84.3% 的分数,但这一说法是供应商声明、仅限预览且未经证实。作者警告不要将未经证实的基准测试视为证据,将其比作营销新闻稿。
-
CalibForge系统合成具有挑战性的AI代理训练任务
研究人员开发了CalibForge,一个旨在为AI代理训练合成和优化终端任务的系统。该系统采用对抗性求解器校准,运用多求解器分歧和对比反馈等策略,在“可学习区”内创建任务。生成的任务旨在具有适当的挑战性,从而在模型使用此数据进行训练时,在Terminal-Bench 2.0、SWE-bench Pro和Doc2Repo等基准测试中带来显著的性能提升。
-
清华大学发布 VeriLoop Coder-E1 用于可验证的代码修复
清华大学的研究人员开源了 VeriLoop Coder-E1,这是一个用于可验证递归自改进以进行代码修复的模型。VeriLoop Coder-E1 基于 Qwen3.6-27B 架构构建,采用“基于证据的螺旋式”方法来增强其代码修复能力。该模型在 SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0 和 DeepSWE 等多个基准测试中表现强劲,尤其是在采用窄域 PEFT 和 Self…
-
xAI 发布 Grok 4.5,该模型在真实开发者工作流上进行训练 · 跟踪 1 个来源
xAI 发布了 Grok 4.5,这是一个拥有 1.5 万亿参数的混合专家(MoE)模型,该模型在 Cursor IDE 的真实开发者交互数据上进行了训练。这种独特的训练方法,包括多文件差异和调试器会话,旨在提高模型在代理工作流中协助开发者的能力。虽然 Grok 4.5 提供了快速的服务速度和超越纯编码的广泛训练组合,但与前代模型相比,其上下文窗口有所减小,并且由于意外包含了 Cursor 的代码库,面临基准测试污染问题。
-
MindForge 管道训练小型 LLM 完成软件工程全生命周期
研究人员开发了 MindForge,这是一个旨在训练小型语言模型执行全面软件工程任务的自动化管道。该系统将开源命令行程序转换为无源代码的训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成程序轨迹上微调 Qwen3.6-27B 模型,研究人员显著提高了其在 ProgramBench 基准测试上的性能,取得了与大型前沿模型相当的结果。微调后的模型在各种未见过的软件工程任务中也表现出广泛的改进,包括代码生成、错误修…
-
MiniMax M3、GLM-5.2、Kimi K3:选择用于代理的开源模型
对三个开源模型—MiniMax M3、GLM-5.2 和 Kimi K3—的比较表明,仅凭排行榜分数不足以做出自行托管的决定。文章强调了显存需求、许可和代理循环延迟等因素,这些因素对于成本效益的部署至关重要。MiniMax M3 利用稀疏注意力处理长上下文,GLM-5.2 是一个具有宽松 MIT 许可的大型 MoE 模型,而 Kimi K3 是代理编码领域的另一个重要竞争者。
-
Anthropic 的 Claude Opus 5 登顶排行榜,但用户对其价值和护栏进行了辩论
Anthropic 发布了 Claude Opus 5,该模型在包括 SWE-bench 和 FrontierBench 在内的多个 AI 排行榜上均取得了最高排名。一项关键创新是在 API 中引入了“effort”参数,允许用户在不切换不同模型版本的情况下调整性能和成本。然而,Hacker News 上的讨论显示,定价和价值主张很复杂,一些分析表明 GPT-5.6 在其成本下提供了更好的性能。此外,用户报告称 Claude Opus…
-
智谱 AI 的 GLM-5.2 以 100 万上下文窗口引领开放权重模型 · 跟踪 1 个来源
来自中国智谱 AI 的新型开放权重模型 GLM-5.2 已被评为截至 2026 年 7 月表现最佳的开放模型。在 Artificial Analysis 的 Intelligence Index v4.1 中,它获得了 51 分,在所有模型中排名第四,在公开可用权重的模型中排名第一。该模型拥有百万级上下文窗口,在编码任务方面表现出色,在 SWE-bench Pro 等基准测试中超越了 GPT-5.5 等竞争对手。
-
OpenAI、Moonshot、Anthropic 发布旗舰模型;基准测试显示各有千秋
OpenAI、Moonshot AI 和 Anthropic 公司迅速发布了各自最新的旗舰模型:GPT-5.6 Sol、Kimi K3 和 Claude Opus 5。这三款模型都提供了巨大的上下文窗口和有竞争力的定价,但性能基准测试揭示了细微的差异。Claude Opus 5 在 SWE-bench Pro 等编码任务和 ARC-AGI-3 等推理基准测试中表现领先,而 GPT-5.6 Sol 在智能终端任务以及 DeepSWE 1…
-
Anthropic 的 Claude Opus 5 性能大幅提升且成本降低 · 跟踪 8 个来源
Anthropic 发布了 Claude Opus 5,这是一款新的前沿模型,与前代 Opus 4.8 相比,在成本降低的同时提供了显著的性能提升。虽然 Anthropic 的官方基准测试突出了大幅提升(通常以比率形式呈现),但详细分析显示,在 SWE-bench Pro 编码基准测试上提高了 10 个点,并在内部生命科学任务上有了显著改进。该模型的定价旨在颠覆市场,以一半的成本提供接近 Fable 5 的能力,引发了关于迁移策略以及…
-
Google 扩展 Gemini,推出更便宜的模型并扩大代理访问范围
Google 扩展了其 Gemini AI 产品,发布了三款新模型,其中包括专为编码和代理任务设计的 Gemini 3.6 Flash。该公司还将其个人 AI 代理 Gemini Spark 提供给 AI Pro 计划的更广泛订阅用户。这些举措旨在平衡模型能力与经济效益和更广泛的分发,特别是对于能够跨各种应用程序管理用户工作流的 AI 代理。
-
Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源
Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。
-
Poolside AI 发布 Laguna S 2.1,一款拥有 1M 上下文的紧凑型编码模型
Poolside AI 发布了 Laguna S 2.1,这是一款拥有 118B 参数的混合专家模型,其中 8B 参数被激活,并拥有 1M token 的上下文窗口。该模型在不到九周的时间内开发完成,在长时程编码基准测试中表现强劲,在同级别模型中超越了体积大其数倍的模型。Laguna S 2.1 在 Terminal-Bench 2.1 上获得了 70.2% 的分数,在 DeepSWE v1.1 上获得了 40.4% 的分数,所有评估…
-
RAG 无法解决幻觉问题;新的中端模型针对代理成本
检索增强生成(RAG)因未能解决 AI 幻觉问题而受到批评,反而将问题转移到检索阶段。一款新的中端模型,定价为 $2/M,在 SWE-bench Pro 基准测试中取得了 63.2% 的成绩,这表明 AI 代理的成本和可访问性可能发生转变。
-
开发者发现 Claude Code 因隐藏的耗时陷阱导致冲刺速度减慢 40%
一位开发者发现,即使使用 Opus 4.7 等高级模型,使用 Claude Code 实际上将他们的开发冲刺速度减慢了约 40%。这种减慢归因于阅读和验证 AI 生成代码所花费的时间,这掩盖了实际所需的努力。开发者确定了三个主要的耗时陷阱:AI 代码生成的欺骗性速度、不经彻底审查就自动接受编辑的倾向,以及当 AI 生成的代码引入细微错误时,上下文切换带来的认知成本。