SWE Bench Pro
PulseAugur coverage of SWE Bench Pro — every cluster mentioning SWE Bench Pro across labs, papers, and developer communities, ranked by signal.
- instance of Claude Opus 4-8 90%
- developed Opus 4.8 90%
- instance of Opus 4.8 90%
- instance of Zhipu AI 90%
- instance of Claude Opus-5 90%
- instance of Kimi k3 90%
- instance of Claude Fable-5 90%
- instance of MAI-Thinking 1 90%
- instance of Terminal Bench 2.0 90%
- used by Minimax 90%
- instance of cubic metre 90%
- instance of Terminal-Bench 90%
5 天有情绪数据
Anthropic's focus on 'abstention' in Opus 4.8 will drive adoption for critical coding tasks
Opus 4.8's improved ability to abstain from answering when uncertain, rather than providing incorrect information, is a critical feature for complex coding tasks. This trait, highlighted in recent evidence, could lead to increased adoption of Claude Opus for high-stakes software development where accuracy and reliability are paramount.
SWE-Bench Pro scores are rapidly increasing, with multiple models surpassing 50%
Recent evidence shows MiniMax's M3 model achieving 59% and Microsoft's MAI-Code-1-Flash achieving 51% on SWE-Bench Pro. This indicates a significant upward trend in AI coding benchmark performance, with several models now breaking the 50% barrier.
MiniMax M3 may become a leading open-source alternative for coding tasks
MiniMax's M3 model has demonstrated strong performance on SWE-Bench Pro (59%) and Terminal Bench 2 (66%), coupled with a 1M token context window. If its accessibility and performance remain competitive, it could emerge as a preferred open-source option for developers seeking advanced coding assistance, potentially challenging proprietary models.
-
Chronos 框架增强了 LLM 代码代理对软件演进的推理能力
研究人员开发了 Chronos,一个旨在帮助基于大型语言模型 (LLM) 的代码代理推理软件演进的新框架。Chronos 将历史上的 pull request 提炼成结构化的“经验卡片”,并通过代码、开发者意图和组织关系的图谱将它们连接起来。这使得语义搜索能够识别相关更改,然后通过多跳扩展检索这些更改以进行选择性阅读。该框架指导代理生成和选择补丁,在 SWE-Bench Verified、SWE-Bench Pro 和 FEA-Ben…
-
Qwen3.8-27B LLM 在 RTX 3090 上驱动编码代理
一位开发者详细介绍了他们在 RTX 3090 GPU 上使用 Qwen3.8-27B 大型语言模型进行编码任务的经验。他们成功地将该模型与 OpenCode 和 llama.cpp 集成,利用 GPU 的 24GB 显存进行推理。虽然该设置能够为小的修复和功能生成有用的代码补丁,但开发者也指出了输出预算耗尽和遗漏缺陷等局限性,这凸显了独立验证的持续重要性。
-
GPT-6 Astra 与 Claude Fable 5.1 在基准测试中对决
OpenAI 的 GPT-6 Astra 与 Anthropic 的 Claude Fable 5.1 的直接比较揭示了每个先进 AI 模型各自的优势。GPT-6 Astra 凭借其 1.1M 的上下文窗口在处理海量代码库方面表现出色,并在形式数学推理方面展现出卓越的性能,在 FrontierMath 上取得了 97.6% 的得分。另一方面,Claude Fable 5.1 在细致的系统提示遵循和复杂的多角色编排方面处于领先地位,在 …
-
OpenAI 标记 SWE-bench Pro 编码基准测试缺陷;新研究重构神经网络训练
OpenAI 发现其先前曾认可为被污染的 SWE-bench 基准测试的替代品的 SWE-bench Pro 编码基准测试存在严重的可靠性问题。这项新分析表明,SWE-bench Pro 本身可能不是衡量 AI 编码性能的可靠指标。另外,一篇新的 arXiv 预印本提出将神经网络训练重构为最优控制问题,旨在误差最高处插入层数,但目前支持该方法的证据有限。
-
MetaRSI-v1 推进 AI 自我改进能力 · 跟踪到 1 个来源
CosmosMind 与多所大学合作推出了 MetaRSI-v1,这是一种新颖的元递归架构,旨在改进 AI 模型中递归自我改进 (RSI) 的过程。该新框架统一了模型、数据和工具改进等不同的 RSI 方法,使 AI 系统能够优化自身的学习和问题解决能力。实验表明,MetaRSI-v1 显著提升了小型 AI 模型和 GPT-5.6、Claude Opus-5 等前沿模型的性能。
-
Claude Opus 4.8 在高级编码基准测试中领先 GPT-5.5;强调治理
一项对领先的编程任务LLM的最新比较显示,GPT-5.5 和 Claude Opus 4.8 在 SWE-bench Verified 基准测试中几乎不相上下,得分均约为 88.7%。然而,在更具挑战性的 SWE-bench Pro 基准测试中,Claude Opus 4.8 表现出显著优势,得分为 69.2%,而 GPT-5.5 为 58.6%。Gemini 3.1 Pro 在验证基准测试中的得分较低,为 80.6%,但其大型上下文…
-
字节跳动HarnessDev基准测试,评估LLM构建代理代码的能力
来自字节跳动Seed及其他机构的研究人员推出了HarnessDev,这是一个旨在评估LLM创建自身代理工具链能力的新基准。与固定工具链的传统基准不同,HarnessDev评估的是LLM自身生成的工具链代码的质量。初步结果表明,虽然LLM可以改进它们的工具链,但只有一部分改进能够泛化到不同的任务中,这表明完全自主改进的代理仍然是一个重大挑战。
-
新的Agentic Coding Index根据智能密度对大型语言模型进行排名
一位Reddit用户开发了一种名为Agentic Coding Index (ACI)的新指标,用于评估大型语言模型(LLM)在编码任务上的表现。ACI使用加权公式汇总了SWE-bench Pro、DeepSWE v1.1和Terminal-Bench等多个编码基准测试的得分。该指标旨在通过考虑模型的参数数量及其在这些多样化编码评估中的表现来衡量模型的“智能密度”,重点在于奖励真正的自主掌握能力。
-
SWE-Prime 过滤 LLM 训练数据以获得更好的软件解析能力
研究人员推出了一种名为 SWE-Prime 的新颖两阶段方法,旨在提高大型语言模型在解决软件问题方面的性能。该方法侧重于精心过滤用于监督微调的代理轨迹数据集,以去除无效或冗余的步骤。通过选择高质量的轨迹子集,然后根据其贡献和潜在风险进一步优化这些轨迹中的片段,SWE-Prime 显著提高了模型性能。在 SWE-Bench Pro 和 SWE-Bench Verified 上的实验表明,使用 SWE-Prime 选择的 10% 子集进行…
-
阿里巴巴预览Qwen4架构,推出成本效益高的Qwen3.8-Flash-Next模型
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是一个开放权重的多模态MoE模型,预览了即将推出的Qwen4的架构。该新模型拥有显著的成本效益,在125B的骨干网络中每个token仅激活6B参数,并额外包含51B的N-gram嵌入。它在包括编码和多模态任务在内的各种基准测试中表现强劲,同时提供原生262K上下文窗口,可扩展至1M token。该架构引入了Qwen Sparse Attention (QSA) 和 G…
-
微软的AutoSaddler自动化AI代理工具链优化
微软的研究人员开发了AutoSaddler,这是一个旨在自动优化AI代理工具链的新系统。该方法将工具链视为代码,并利用失败跟踪离线学习进行修补。AutoSaddler会迭代地运行任务,诊断失败,为提示和控制逻辑生成结构化补丁,并在更新前验证这些更改。与基础工具链相比,该系统在GAIA2上取得了9.0分的提升,在SWE-Bench Pro上取得了9.6分的提升,在Terminal-Bench 2.0上取得了10.0分的提升,显示出显著的改进。
-
Anthropic 的 Fable 5 表现不佳,企业倾向于更便宜的 Opus 4.8
尽管 Anthropic 开发了 Fable 5 等高度强大的 AI 模型,但企业支出正转向其更旧、更经济实惠的 Opus 4.8 模型。Ramp 的数据显示,Opus 4.8 约占 Anthropic 平台支出的 50%,而较新的 Fable 5 仅占 11%。这一趋势表明,对于大多数 AI 任务,企业优先考虑成本效益而非绝对最佳性能,而来自 OpenAI 的竞争性定价和来自中国的开源模型加剧了这一挑战。
-
LLM 生产就绪性需要超越基准测试的 10 项测试
一份 2026 年的 LLM 评估清单强调,要超越简单的基准分数,进行全面的生产就绪性测试。Quokka Labs 开发的这种方法侧重于评估整个 AI 系统,包括其数据检索、工具、护栏和失败路径,而不仅仅是模型固有的能力。关键测试包括从实际工作中构建黄金数据集、衡量任务成功率而非写作质量、区分幻觉和 RAG 基础评估、打破输出合同以及进行安全和策略边界的红队测试。
-
Qwen3.8-27B开源模型凭借先进的智能体能力登顶排行榜
阿里巴巴的Qwen团队已开源Qwen3.8-27B,这是一个拥有270亿参数的模型,在包括SWE Bench Pro和OSWorld在内的多个基准测试中取得了顶级排名。该模型在智能体能力方面展现出显著的进步,例如规划和多步任务完成,其表现优于更大的模型甚至云端旗舰模型。其架构融合了线性和全注意力层的创新组合,以高效处理长上下文,并为用户提供可控的“思考”模式。该模型的跨模态训练使其能够有效地在桌面、浏览器和移动设备等各种界面上运行。
-
九章智算云聚焦AI基础设施的训练推理一致性
九章智算云正在开发一个专注于“训练推理一致性”的AI基础设施系统,以支持日益增长的对强化学习(RL)以扩展模型能力的需求。该系统旨在高效管理模型的持续生成、训练和更新,超越简单的“模型+算力”范式。通过集成生成器、环境和训练器等组件,并优化它们之间的动态匹配,九章智算云力求降低成本并提高有效token的产出和模型性能。
-
阿里巴巴 Qwen 3.8-27B 模型在 SWE-Bench Pro 上超越 Claude Opus 4.6 Max
阿里巴巴新款开源模型 Qwen 3.8-27B 在 SWE-Bench Pro 基准测试中表现优于 Anthropic 的 Claude Opus 4.6 Max,得分分别为 61.7 和 53.4。这款拥有 270 亿参数的模型能够运行在单块 24GB GPU 上,并支持 262,000 个 token 的原生上下文窗口。Qwen 3.8-27B 以 Apache 2.0 许可证发布。
-
Qwen3.8-27B 开源模型在基准测试中可与 Claude Opus 相媲美
Qwen 发布了其 Qwen3.8-27B 模型,这是一个开源模型,在各种基准测试中,尤其是在编码和代理任务方面,其性能可与 Claude Opus 4.6 Max 等更大、专有的模型相媲美。这个拥有 270 亿参数的模型设计用于在消费级 GPU 上运行,提供 262K 的原生上下文窗口,可扩展至 100 万个 token。它还具有原生多模态能力,能够处理图像、PDF 甚至视频,并具有可定制的推理深度以提高效率。
-
Sonnet 5 在 SWE-bench Pro 上达到 63.2%;OpenAI 的 Terra 声称的基准分数未经证实
一款新的人工智能模型 Sonnet 5 在 SWE-bench Pro 基准测试中取得了 63.2% 的分数。另外,OpenAI 的模型 Terra 据称在 Terminal-Bench 上获得了 84.3% 的分数,但这一说法是供应商声明、仅限预览且未经证实。作者警告不要将未经证实的基准测试视为证据,将其比作营销新闻稿。
-
CalibForge系统合成具有挑战性的AI代理训练任务
研究人员开发了CalibForge,一个旨在为AI代理训练合成和优化终端任务的系统。该系统采用对抗性求解器校准,运用多求解器分歧和对比反馈等策略,在“可学习区”内创建任务。生成的任务旨在具有适当的挑战性,从而在模型使用此数据进行训练时,在Terminal-Bench 2.0、SWE-bench Pro和Doc2Repo等基准测试中带来显著的性能提升。
-
清华大学发布 VeriLoop Coder-E1 用于可验证的代码修复
清华大学的研究人员开源了 VeriLoop Coder-E1,这是一个用于可验证递归自改进以进行代码修复的模型。VeriLoop Coder-E1 基于 Qwen3.6-27B 架构构建,采用“基于证据的螺旋式”方法来增强其代码修复能力。该模型在 SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0 和 DeepSWE 等多个基准测试中表现强劲,尤其是在采用窄域 PEFT 和 Self…