SWE-bench
PulseAugur coverage of SWE-bench — every cluster mentioning SWE-bench across labs, papers, and developer communities, ranked by signal.
- used by GLM-5.2 90%
- instance of Claude Sonnet 4.6 90%
- instance of DeepSeek V4-Pro 90%
- used by arXiv 70%
- competes with Terminal-Bench 70%
- instance of HumanEval 70%
- instance of Terminal-Bench 70%
- used by Claude (Opus 4.8) 70%
- instance of Claude Fable-5 70%
- instance of SWE-bench Verified 70%
- used by LLM 70%
- used by Claude Fable-5 70%
17 天有情绪数据
-
Muse Glimmer 30B:社区测试揭示性能与基准测试结果不一
Meta发布Muse Glimmer 30B模型两周后,社区测试揭示了其性能与官方基准测试相比更为细致。虽然Glimmer在代理任务和工具调用方面表现出色,但独立评估表明,在编码任务方面,其性能与Qwen 3.6 27B等竞争对手相当,而非优于它们。该模型还支持通过QLoRA进行高效微调,但用户需注意保留逐步推理示例以维持其能力。此外,Glimmer表现出独特而自信的个性,其发布时机可能是为了在竞争模型出现之前吸引市场关注的战略举措。
-
Meta 的 Muse Video 泄露,Replit 提供免费 GPT-5.6 Luna,AI 监管辩论
Meta 的 Muse Video 模型已在封闭测试中揭晓,展示了其生成具有强大时间一致性和细节的 10 秒视频的能力,包括原生音频。与此同时,Replit 推出了免费模式,允许用户在日常任务中利用 OpenAI 的 GPT-5.6 Luna 模型而无需消耗积分,从而提高生产力。此外,文章还讨论了 AI 监管策略、AI 代理在基准测试中作弊的可能性,以及优化 DeepSeek-V4-Pro 等大型 AI 模型服务的方法。
-
Ornith AI 发布 Ornith-1.5 模型系列,专注于自我改进
Ornith AI 发布了 Ornith-1.5 模型系列,其中包括一个 9B 的密集模型以及 35B 和 397B 的混合专家(MoE)变体。这些模型旨在实现自我改进,并在推理、编码和代理任务等各种基准测试中表现出与 Claude Opus 4.8 等成熟模型相媲美的性能。这些模型可在 Hugging Face 上获取,并兼容 Transformers、llama.cpp、vLLM 和 SGLang 等流行推理工具,并提供了集成说明。
-
研究发现:编码基准分数可能无法反映通用AI能力
一篇新论文认为,针对SWE-bench等特定编码基准优化AI模型,并不一定会提升其通用编码能力。研究人员发现,在这些基准上训练的模型在转移到其他任务(包括一个基于Django的自定义基准套件)时表现出有限的迁移性。该论文提倡采用更多样化的评估方法,例如对前沿模型的整体评估和研究用的多任务套件,以确保对AI编码能力的可靠评估。
-
HELIX系统实现AI代理的递归式自我改进
研究人员推出HELIX,一种用于AI模型及其运行时工具协同进化的新基础架构。该方法侧重于在改进模型本身的同时,改进作为代理上下文、工具和控制流中介的系统——即工具。通过为固定模型进化工具,然后根据已验证的轨迹更新模型,HELIX旨在实现递归式自我改进。该系统将代理组件分解为类型化端口、可重用原子和策略,使得干预明确且可审计。在代码修复任务上的初步评估表明,HELIX能够发现显著提高任务覆盖率的工具,并为后续模型训练生成有价值的数据。
-
Graft 工具通过构建代码库图来增强编码代理
Graft 是一款旨在增强 Claude Code、Cursor 和 Gemini 等编码代理上下文理解能力的新工具。它通过构建代码库的图来实现这一点,代码库被表示为链接的 markdown 文件,代理可以引用这些文件。这种方法旨在通过为代理提供预编译的代码组件解释,类似于人类工程师如何适应项目,从而减少冗余探索、节省 token 并降低延迟。该工具通过 CLI 集成,并可以提交到 Git,从而实现团队成员之间的代码库共享理解。
-
DeepSeek V4 Pro 在实际前端测试中展现出强大的编码能力提升
DeepSeek 发布了其 V4 Pro 模型,与前代 V3.1 相比,在代码生成和推理能力方面有了显著提升。虽然官方基准测试突显了其进步,但本文侧重于通过实际前端开发测试来评估其真实世界性能。V4 Pro 提供了具有竞争力的性价比,尤其与 Claude 3.5 Sonnet 等模型相比,使其成为自动化代理任务的吸引人选择。
-
Meta 发布用于代理任务的开源 Muse Glimmer 模型
Meta 发布了 Muse Glimmer,一个基于 Apache 2.0 许可的新型 30B 参数开源模型。该模型专为端到端代理任务完成、可靠的工具使用和多步推理而设计,在 DeepSearch QA 和 SWE-Bench 等基准测试中表现强劲。然而,其内存需求(压缩后约 24-32 GB)可能会限制其在许多消费级笔记本电脑上的本地使用,而早期基准测试表明其效率可能低于 Qwen 等竞争对手。
-
开发者创建自定义工具来对个人 Bug 进行编码 LLM 基准测试
一位开发者创建了一个基于 Python 的工具,用于针对个人 Bug 语料库评估编码 LLM,而不是依赖于 SWE-bench 等公共基准。这种方法旨在通过测试模型在用户自身代码库特有的问题上的表现,提供更相关的性能指标。该工具设计为可与任何 OpenAI 兼容的 API 配合使用,从而可以轻松集成本地和托管模型。
-
Meta 发布 Muse Glimmer,一款用于本地 AI 代理的 30B 开源模型
Meta 发布了 Muse Glimmer,一个拥有 300 亿参数的开源模型,针对本地代理工作流进行了优化。该模型设计用于在消费级硬件(如单个 GPU)上运行,使其可用于个人使用以及需要更高数据控制的企业应用。Muse Glimmer 在编码、工具使用和多步推理等任务中表现出色,旨在普及先进的 AI 功能。
-
AI 编码代理的 token 节省工具承诺过高,基准测试显示
对五种用于编码代理的 token 节省工具进行的最新基准测试显示,其宣传的 60-90% 的节省率在实际代理工作负载中并未实现。该研究使用了来自 SWE-bench 的 48 个 Django 问题,发现表现最好的工具 repowise 与未使用工具的基线相比,实现了约 32% 的 token 缩减。CodeGraph 等其他工具也显示出显著但较小的缩减。基准测试还强调了索引时间方面的权衡,尽管 repowise 在 token 节省…
-
NVIDIA 发布 NOOA 框架,实现统一的 AI 代理开发
NVIDIA Labs 发布了 NOOA,这是一个开源 Python 框架,旨在通过将所有组件封装在单个 Python 类中来简化 AI 代理的开发。这种方法集成了提示模板、工具模式和工作流逻辑,允许开发人员和模型共享统一的接口,以改进测试和版本控制。NOOA 通过 LiteLLM 支持各种 LLM,并在 SWE-bench 和 ARC-AGI 等基准测试中表现出色,尽管目前它仍被视为研究预览版,并且需要操作系统级别的隔离才能安全部署。
-
OpenAI 发布 GPT-5,具备实时推理能力,提升性能
OpenAI 发布了其最新语言模型 GPT-5,该模型具有增强的实时推理能力,能够让它在响应前逐步思考问题。与 GPT-4 Turbo 相比,新模型在编码、数学和科学问题解决方面表现出显著的性能提升。GPT-5 可通过 API 访问,并采用分级定价结构,还将为 OpenAI 即将推出的自主代理产品提供支持,加剧了人工智能领域的竞争。
-
集成Graft工具的Sonnet 5在编码任务上优于Opus 5
Reddit的r/ClaudeAI板块的一位用户发现,将Sonnet 5与名为Graft的工具结合使用,在大多数编码任务上优于Opus 5。Graft会创建一个代码仓库的上下文图,使Claude Code能够自动加载相关部分,从而减少令牌使用量和延迟。与冷启动的Sonnet 5实例相比,这种方法在SWE-bench上的表现更好,用户认为改进上下文管理比仅仅升级到更强大的模型更具影响力。
-
COMPAS方法通过联合调整模型、提示和设置来优化代码生成
研究人员开发了一种新颖的COMPAS方法,通过联合搜索模型、提示和解码设置来优化代码生成。这种难度感知方法学习特定组的质量-成本前沿,使其能够在不进行额外搜索的情况下将测试任务路由到最高效的配置。COMPAS在LiveCodeBench和SWE-bench等基准测试中显著提高了性能,提高了pass@1率和任务解决率,同时大幅降低了成本。
-
LLM 基准分数因“饱和悖论”在生产中失效
由于“基准饱和悖论”,静态学术基准在评估企业 LLM 方面的效果越来越差。在该悖论中,在 MMLU 和 SWE-bench 等排行榜上得分很高的模型在实际生产任务中的表现却很差。这种差异源于数据污染、干净的基准提示与混乱的用户输入之间的差异,以及基准的静态性质与生产环境中所需的状态化执行之间的差异。为确保可靠性,工程团队应实施持续生产评估 (CPE) 管道,使用实际用户数据,而不是仅仅依赖公共基准。
-
新工具PAIChecker识别LLM基准中的PR-问题不匹配
研究人员开发了PAIChecker,一个多智能体系统,旨在识别和纠正用于评估大型语言模型(LLM)的基准中拉取请求(PR)与其相关问题之间不匹配的情况。对SWE-bench Verified实例的研究显示,在各种模式下,13.6%的PR-问题配对存在不匹配。PAIChecker采用三阶段方法,结合模式识别、标签合成和代码级验证,以确保更准确和可泛化的基准构建。实验表明,PAIChecker在SWE-Gym和SWE-bench Mult…
-
Bespoke Labs 寻求研究员开发长期代理基准
Bespoke Labs 正在寻找一名研究员,为长期代理任务开发和评估强化学习环境和基准。该职位要求具备多步推理代理的实践经验,特别是提及对 SWE-bench 和 Gymnasium 等环境的贡献。该职位为远程合同,申请将根据长期代理工作的具体证据进行筛选。
-
新研究识别出LLM评估器中的“代理形式主义陷阱”
一篇新研究论文介绍了“代理形式主义陷阱”和“评估失调指数”($D_E$),用于衡量基于大型语言模型(LLM)的评估系统如何在对抗性条件下被共识模仿所误导。该研究分析了GAIA、SWE-bench和Multi-Challenge领域中的22,500个轨迹,并识别出一种幻觉操纵分类法。研究结果表明,LLM评估器以一种领域无关的方式容易受到这种“捕获”,模拟的群体拓扑结构会影响语义盲点,并强调了在闭环评估系统中需要特定架构的警惕过滤器。
-
LLaMA 社区寻求最佳基准来验证本地模型性能
r/LocalLLaMA 子版块的用户正在寻求关于最佳基准的建议,以评估他们本地运行的大型语言模型 (LLM) 的性能。发帖人正在寻找衡量模型有效性的方法,特别是用于 Hermes、Paperless-ngx 和 Home Assistant 等代理,并且不确定 SWE-bench 等基准与其特定用例的相关性。社区被要求分享他们偏好的性能衡量方法。