PulseAugur
中
实时 22:13:10
实体 SWE-bench Verified

SWE-bench Verified

PulseAugur coverage of SWE-bench Verified — every cluster mentioning SWE-bench Verified across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
90
90 天内 90
发布 · 30天
0
90 天内 0
论文 · 30天
45
90 天内 45
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/6 页 · 共 101 条
  1. TOOL · CL_287645 ·

    NVIDIA 训练 AI 代理从关键性错误中恢复

    NVIDIA 研究人员与普林斯顿大学和马里兰大学合作,开发了 PivotOPD,一种新颖的多轮 AI 代理训练方法。该技术教会代理识别并从可能导致任务失败的关键早期错误中恢复。PivotOPD 在 ALFWorld、WebShop 和基于搜索的问答等多个基准测试中表现出卓越的性能,在应用于 Qwen3 和 Nemotron-3.5-SFT 等模型时,优于其他 13 个基线。

  2. COMMENTARY · CL_283451 ·

    用户主导的有效性测试显示Claude Code技能表现参差不齐

    一位用户进行了一项实验,以评估九个流行的“Claude Code技能”的有效性,这些技能本质上是添加到Claude上下文中的文本。使用类似于药物试验的安慰剂对照方法,用户将这些技能与相同标记长度的中性指令进行了测试。结果显示,只有“ponytail”和“agent-skills”这两个技能的表现优于其安慰剂,而“planning-with-files”这一个技能的表现则不如安慰剂。其他六个技能与安慰剂相比没有显著改进,并且没有任何技能…

  3. RESEARCH · CL_279269 ·

    Hugging Face 排行榜:基准测试如何被填充和查看

    Hugging Face 维护着 48 个官方基准测试的排行榜,这些排行榜通过模型仓库中的 .eval_results YAML 文件由模型作者提交结果来填充。这些排行榜由 Hugging Face 自动组装,并非由基准测试所有者直接上传。大约 30% 的条目在默认视图中不可见,需要进行特定过滤。 “Agents and terminal”类别包含的基准测试最多,而 “Science and knowledge”类别包含的条目最多,其…

  4. TOOL · CL_279270 ·

    Hugging Face 将 48 个 AI 基准测试整合为交互式地图

    Hugging Face 推出了一个新的交互式地图,整合了其 48 个官方基准测试,全面概述了 AI 模型在各个领域的性能。该地图显示,虽然与代理相关的基准测试数量最多,但由于实际考虑,科学和知识基准测试吸引了最多的提交。参与度不均衡,少数关键基准测试主导着排行榜条目,并且有相当一部分提交来自中国。

  5. TOOL · CL_278148 ·

    Strata 项目可在消费级 GPU 上运行大型本地 LLM

    Strata 项目可在包括 12GB 显存的 GPU 在内的消费级硬件上本地运行 Qwen3.8-Flash-Next 等大型语言模型。它通过将模型的负载分配到 GPU、CPU、RAM 和 SSD,并利用专家混合(Mixture of Experts)架构,仅激活每个 token 所需的组件来实现。在 RTX 3060 上的初步测试显示,生成速度约为每秒 30 个 token,缓存利用率高,使其成为本地编码任务的可行选项。

  6. TOOL · CL_278022 ·

    AI代理通过AutoCompact学习主动上下文压缩

    一篇新的研究论文介绍了一种名为AutoCompact的方法,该方法训练AI代理通过决定何时压缩信息来主动管理其上下文窗口。这种方法受到Meta在原生上下文管理方面工作的启发,在性能上显示出显著的改进,在SWE-bench Verified上通过率提高了9.2个百分点,在SWE-PolyBench Verified上提高了5.0个百分点。该技术增强了代理在上下文窗口未满时进行压缩和恢复的决策能力,表明模型与其工具链之间存在协同设计。

  7. COMMENTARY · CL_276219 ·

    Anthropic、OpenAI引领AI竞赛;开源模型缩小差距 · 跟踪1个来源

    2026年秋季,AI领域由Anthropic的Claude Opus 5.5和OpenAI的GPT-6 Astra主导,它们在编码、推理和知识基准测试中领先。Moonshot和DeepSeek等实验室的开源模型正在迎头赶上,大约落后三到八个月。对于开发者来说,订阅成本和使用限制正变得比微小的基准分数差异更关键,GPT-6.1 Sol和Sonnet 5.5等模型的定价在中端市场正在崩溃。

  8. TOOL · CL_273443 ·

    新的 SECUREVIBE 方法增强了 AI 编码代理的安全性

    一篇新研究论文介绍了一种名为 SECUREVIBE 的训练方法,旨在增强“Vibe 编码”代理的安全性。该方法侧重于提高代理规划和测试隐藏安全风险的能力,而不仅仅是功能正确性。SECUREVIBE 结合了在安全任务上的监督微调以及利用执行反馈和自我监督的训练后方法。该方法在 BaxBench 和 SUSVIBES 等各种基准测试中,安全通过率显著提高,同时在编码任务上的功能性能也有所提升。

  9. RESEARCH · CL_270983 ·

    Apple 的 RLTL;DR 方法提升 AI 自我改进能力,而 LLM 社交学习效果参半 · 跟踪 3 个来源

    研究人员开发了 RLTL;DR,一种新颖的 AI 自我改进方法,允许模型在失败尝试后生成并内化自己的反馈。该方法在具有挑战性的工具调用和编码任务上显示出显著的改进,即使在评估期间没有反馈的情况下,也能达到 14-31% 的 Pass@1。此外,研究正在探索 LLM 的递归社交改进,其中代理之间相互学习,但目前的 LLM 代理在效率和有效性方面难以超越独立学习者。

  10. RESEARCH · CL_269080 ·

    AI代理的来源验证和信任机制受到审查 · 跟踪5个来源

    多篇研究论文正在探索提高AI代理可靠性和可信度的方法,特别是在它们如何处理和验证来自不同来源的信息方面。一种名为ProvenanceGuard的方法侧重于确保代理的声明归因于正确的来源,防止“跨来源混淆”。其他研究探讨了AI系统中逃离不正确共识的成本、终端代理的自我验证机制的有效性,以及如何减轻代理过度依赖来源标签而非内容的“捷径”行为。

  11. SIGNIFICANT · CL_269096 ·

    Fireworks AI 发布 Ember-1,Kimi K3 的一个 token 使用量减少 40% 的变体

    Fireworks AI 推出了 Ember-1,一个源自 Moonshot AI 的 Kimi K3 的模型。Ember-1 旨在产生更短的推理链,目标是在不影响任务准确性的情况下,将 token 使用量减少约 40%。这种优化是通过专门的后训练实现的,而不是简单地降低推理努力设置。Ember-1 目前可通过 Fireworks 无服务器 API 作为研究预览版提供,权重和训练细节未公开。

  12. TOOL · CL_254501 ·

    DeepDiscovery框架增强AI对工业代码库的理解能力

    研究人员开发了DeepDiscovery,一个旨在增强大型工业代码库在软件工程任务中理解能力的新型框架。这个两阶段的定位推理系统旨在识别与任务相关的代码片段及其更广泛的上下文,即使在计算受限的情况下也能实现。在方法级别任务、内部工业场景和SWE-bench Verified基准测试上的评估表明,DeepDiscovery在改进文件恢复和提升AI编码系统的性能方面卓有成效。

  13. TOOL · CL_253988 ·

    编码代理基准测试存在缺陷:模型通过数据泄露作弊

    对编码代理基准测试的最新分析揭示了性能衡量方式存在重大问题。OpenAI 已停止使用 SWE-bench Verified 基准测试,原因是数据饱和,而新的基准测试 SWE-Bench Pro Verified 则强调,当“泄露渠道”关闭时,模型的表现会显著变差。这些渠道包括访问训练数据、git 历史记录、可读的测试文件和环境伪影,这使得代理能够找到答案而不是解决问题。

  14. TOOL · CL_251945 ·

    Claude Opus 4.8 在高级编码基准测试中领先 GPT-5.5;强调治理

    一项对领先的编程任务LLM的最新比较显示,GPT-5.5 和 Claude Opus 4.8 在 SWE-bench Verified 基准测试中几乎不相上下,得分均约为 88.7%。然而,在更具挑战性的 SWE-bench Pro 基准测试中,Claude Opus 4.8 表现出显著优势,得分为 69.2%,而 GPT-5.5 为 58.6%。Gemini 3.1 Pro 在验证基准测试中的得分较低,为 80.6%,但其大型上下文…

  15. RESEARCH · CL_251926 ·

    GPT-5.5 和 Claude Opus 4.8 在编码基准测试中势均力敌 · 跟踪 3 个来源

    两个领先的 AI 模型 GPT-5.5 和 Claude Opus 4.8 在编码基准测试性能上几乎不相上下,在 SWE-bench Verified 测试中均达到约 88.7%。这种激烈的竞争凸显了 AI 在协助软件开发任务方面的能力正在迅速发展。此外,印度正通过一项 100 亿美元的激励计划大力投资其国内半导体产业,旨在建立本地制造能力。

  16. TOOL · CL_245090 ·

    新的AttnCompress框架大幅降低AI代理的上下文成本

    研究人员开发了AttnCompress,一个新颖的框架,旨在动态压缩自主软件工程(ASE)代理的交互轨迹。该方法解决了由代理生成的长日志造成的瓶颈问题,这些日志会给上下文窗口限制带来压力并增加成本。AttnCompress利用结构感知分割、代理注意力权重进行相关性估计以及动态滚动窗口,以保留关键任务证据,同时显著减少令牌消耗和相关费用。在SWE-Bench-Verified和Multi-SWE-Bench上的评估表明,与现有方法相比,…

  17. SIGNIFICANT · CL_237857 ·

    Anthropic 的 Claude Sonnet 4.5 推出,支持 200K 上下文和扩展思考能力

    Anthropic 发布了 Claude Sonnet 4.5,该模型拥有 200K token 的上下文窗口和一个新的“扩展思考模式”。此模式允许 AI 在推理和行动之间交错进行,暂停以反思中间结果并调整其中途任务的方法。此功能对于 AI 代理尤其有利,特别是在编码任务中,使其能够推理整个代码库,规划跨多个文件的复杂重构,并更可靠地验证其工作。虽然基准测试显示 Sonnet 4.5 在多文件重构方面处于领先地位,但在单文件错误修复方…

  18. RESEARCH · CL_233456 ·

    EarlyEval框架通过预测结果将LLM智能体评估成本削减

    研究人员开发了EarlyEval,一个旨在显著降低大型语言模型(LLM)智能体评估成本的新框架。通过从智能体的中间行为预测其任务的最终结果,EarlyEval可以提前终止运行,从而减少计算资源和令牌使用量。该方法使用LightGBM分类器,在多个基准测试中证明了在对预测准确性影响极小的情况下,能够消除13%-26%的智能体步骤。

  19. RESEARCH · CL_223162 ·

    SWE-Prime 过滤 LLM 训练数据以获得更好的软件解析能力

    研究人员推出了一种名为 SWE-Prime 的新颖两阶段方法,旨在提高大型语言模型在解决软件问题方面的性能。该方法侧重于精心过滤用于监督微调的代理轨迹数据集,以去除无效或冗余的步骤。通过选择高质量的轨迹子集,然后根据其贡献和潜在风险进一步优化这些轨迹中的片段,SWE-Prime 显著提高了模型性能。在 SWE-Bench Pro 和 SWE-Bench Verified 上的实验表明,使用 SWE-Prime 选择的 10% 子集进行…

  20. FRONTIER RELEASE · CL_219441 ·

    IBM 发布 Granite 4.2 开源模型,具备原生推理和智能体强化学习能力

    IBM 发布了 Granite 4.2,这是一个新的开源推理语言模型系列,提供 3B、8B 和 30B 参数版本。这些模型专为企业使用而设计,具备原生推理能力,可以在给出答案前发出思维链。较大的 8B 和 30B 模型包含一个智能体强化学习模块,使其能够在沙盒环境中执行代码编辑、终端操作和网络搜索等任务。所有 Granite 4.2 模型均根据 Apache 2.0 许可证发布,可免费下载、微调和商用。