PulseAugur
实时 07:34:15
实体 SWE-bench Verified

SWE-bench Verified

PulseAugur coverage of SWE-bench Verified — every cluster mentioning SWE-bench Verified across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
23
90 天内 81
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 43
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/5 页 · 共 81 条
  1. RESEARCH · CL_210387 ·

    对抗性审查:用于基于代理的代码审查的结构化分歧

    研究人员引入了对抗性审查(AR),一种新颖的 AI 代码审查协议,该协议利用最少的三代理系统来促进结构化分歧。这种方法旨在缓解

  2. TOOL · CL_209263 ·

    Microsoft的Agent Lightning v1.0提升了Qwen3.5-9B在SWE-bench上的表现

    微软开发了Agent Lightning v1.0,这是一个连接强化学习以进行智能体训练的系统。这项新工作利用了一个端点代理来集成任何连接器,使训练器能够与环境循环进行交互。通过使用这种方法,并辅以适度的计算资源和6,000个训练示例,微软成功地将Qwen3.5-9B在SWE-bench Verified基准测试上的性能从41.8%提高到了56.4%。

  3. TOOL · CL_205908 ·

    新技术可在无共享提示词的情况下将隐藏消息嵌入 LLM 文本

    研究人员开发了一种名为同步 Logit 引导 (SLS) 的新型隐写术技术,该技术能够将隐藏消息嵌入大型语言模型生成的自然流畅的文本中。与之前需要发送方和接收方使用相同提示词上下文的方法不同,SLS 从输出本身派生出代理提示词,从而消除了在检索增强生成等生产环境中使用共享提示词的需要。该技术已证明了其实际的隐蔽性和容量,实现了显著的信息密度,并产生了在统计上与标准生成无法区分的输出。

  4. RESEARCH · CL_205651 ·

    研究发现:代码助手召回率优化可能阻碍问题解决

    arXiv上的一项新研究表明,在代码助手中优化检索配置以提高recall@k可能会适得其反,降低问题解决率。研究发现,禁用一个特定的文件去重标志(该标志降低了召回率)实际上提高了GPT 5.6 "Sol"和Qwen3.6-27B等模型的单次解决率。这种效应在词汇BM25检索器上未被观察到,这表明在固定预算的代码修复任务中,检索策略与LLM性能之间存在复杂的相互作用。

  5. RESEARCH · CL_198175 ·

    研究人员开发 Self-Harness,使 LLM 代理能够自主改进其自身系统

    一篇新研究论文介绍了一种名为“Self-Harness”的方法,该方法允许基于 LLM 的代理自主改进其自身的运行 Harness。这个迭代过程包括识别模型特定的失败模式、生成 Harness 修改以及通过回归测试验证这些更改。当应用于各种模型和基准测试时,Self-Harness 持续提高了性能,为实现自改进的 AI 代理指明了方向。

  6. TOOL · CL_198059 ·

    研究发现:心理影响策略会影响LLM代码生成

    一项新发表在arXiv上的研究探讨了人类交流中常用的心理影响策略如何影响大型语言模型(LLMs)在代码生成任务中的表现。研究人员将Yukl & Falbe分类法中的八种影响策略改编为提示模板,并在LiveCodeBench和SWE-bench Verified基准上对五种领先的开源LLM进行了测试。研究结果表明,某些提示框架,特别是那些传达紧迫感的提示,与代码正确性和安全性下降有关。

  7. TOOL · CL_196784 ·

    Claude 4 的扩展推理功能增强了复杂问题解决能力和可审计性

    Claude 4 的扩展推理模式允许 AI 在提供答案前对复杂问题进行审议,为高级用户提供可追溯的推理过程。该功能在智能合约审计(如在 Stellar 区块链上)和数字取证等任务中已被证明非常有用,这些任务需要详细的解释和可验证的步骤。虽然此模式会消耗更多资源,但可以针对高成本错误场景进行战略性部署,从而提高准确性并为关键分析提供可审计的工件。

  8. TOOL · CL_193551 ·

    可视化代码表示对 AI 编码代理效果参半

    一项新研究探讨了使用渲染代码作为 AI 编码代理的可视化表示,旨在降低令牌成本并改善存储库级别的问题解决能力。研究发现,虽然可视化代码可以减少提示令牌的费用并基本保持修复准确性,但它并未从根本上提高底层模型或代理架构的性能限制。可视化代码的有效性是有条件的,当原始源代码阅读是主要瓶颈时,它最有效,但在补丁测试的反复试验阶段优势有限。

  9. TOOL · CL_211797 ·

    Benzi 编码代理在 SWE-bench 基准测试中超越 Claude Code

    Benzi,一个新推出的编码工具和代理,在 SWE-bench Verified 基准测试中展现出优于 Claude Code 的性能。Benzi 采用了一种新颖的方法,在回答查询之前将整个代码库编译成一个已解析的映射表,而不是简单地将文件转储到上下文窗口中。这种方法使 Benzi 能够更准确地跟踪调用、数据流和引用,从而提高解决率并降低每个实例的成本,尤其是在 DeepSeek v4-flash 等模型上运行时。

  10. TOOL · CL_183242 ·

    新工具PAIChecker识别LLM基准中的PR-问题不匹配

    研究人员开发了PAIChecker,一个多智能体系统,旨在识别和纠正用于评估大型语言模型(LLM)的基准中拉取请求(PR)与其相关问题之间不匹配的情况。对SWE-bench Verified实例的研究显示,在各种模式下,13.6%的PR-问题配对存在不匹配。PAIChecker采用三阶段方法,结合模式识别、标签合成和代码级验证,以确保更准确和可泛化的基准构建。实验表明,PAIChecker在SWE-Gym和SWE-bench Mult…

  11. TOOL · CL_179556 ·

    DeepSeek V4-Pro 以强劲的基准性能引领开源编码大模型

    DeepSeek V4-Pro 已成为顶级开源编码大模型,在 SWE-bench Verified 基准测试中取得了令人印象深刻的 80.6%。虽然该模型需要大量的服务器基础设施,但其他强大的开源选项正变得可用于本地 GPU 使用。本文旨在指导用户根据其特定需求和可用硬件选择最佳模型。

  12. TOOL · CL_178119 ·

    清华大学发布 VeriLoop Coder-E1 用于可验证的代码修复

    清华大学的研究人员开源了 VeriLoop Coder-E1,这是一个用于可验证递归自改进以进行代码修复的模型。VeriLoop Coder-E1 基于 Qwen3.6-27B 架构构建,采用“基于证据的螺旋式”方法来增强其代码修复能力。该模型在 SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0 和 DeepSWE 等多个基准测试中表现强劲,尤其是在采用窄域 PEFT 和 Self…

  13. COMMENTARY · CL_177893 ·

    供应商就“智能体开发生命周期”的定义展开争论

    “智能体开发生命周期”(ADLC)这一概念的出现,是为了应对人工智能系统带来的独特挑战,这些挑战打破了传统的软件开发假设。然而,关于其定义、结构和必要性,供应商和分析师之间存在显著分歧。尽管由于人工智能不可预测的行为和快速的演变,人们认识到需要一种新的方法,但不同的公司却不一致地将 ADLC 一词应用于他们现有的或略有修改的流程。

  14. FRONTIER RELEASE · CL_175302 ·

    Thinking Machines 发布 Inkling-Small,性能超越更大模型

    Thinking Machines Lab 推出了 Inkling-Small,这是一款新的开源多模态模型,它优先考虑效率而非单纯的规模。尽管比其前身 Inkling 体积小得多,Inkling-Small 在各种编码和推理基准测试中表现出卓越的性能。该模型设计用于更轻松的部署,能够在一台 GPU 上运行,并根据 Apache 2.0 许可证提供。

  15. RESEARCH · CL_193084 ·

    DarwinX 系统利用自然选择进化 LLM 智能体束缚

    研究人员推出 DarwinX,这是一个采用自然选择原理来进化大型语言模型 (LLM) 智能体“束缚”的新颖系统。DarwinX 不修改模型权重,而是通过将提示、工具、技能和控制流视为经历选择的种群来优化它们。这种方法旨在提高智能体在各种基准和任务上的能力和适应性,而无需手工挑选的解决方案或黄金标准。

  16. TOOL · CL_172844 ·

    NVIDIA 发布用于 AI 代理的 NOOA 框架,采用 Python 对象

    NVIDIA 推出了 NOOA,一个用于构建 AI 代理的新框架,它将 Python 对象作为核心抽象。这种方法旨在将通常分散在提示模板、工具模式和工作流图中的代理开发整合到一个单一的约定中。通过将代理视为 Python 对象,其方法可以代表动作,字段可以存储状态,文档字符串可以充当提示,类型注解可以充当契约。这种集成允许确定性的 Python 代码与概率性的 LLM 补全并行,使代理行为更具可测试性和可重构性。

  17. TOOL · CL_170665 ·

    Claude Code 与 Cursor 对比:面向开发者的 AI 编码工具比较 · 已追踪 6 个来源

    开发者正在比较 Claude Code 和 Cursor 这两款 AI 编码工具,它们各有优劣。Claude Code 是一款原生于终端的智能体,凭借其大型上下文窗口和先进的智能体能力(由 Claude Opus 4.6 等模型驱动),在复杂的、多文件的重构和自主规划方面表现出色。Cursor 是一个 VS Code 的分支,提供更集成的 IDE 体验,具有更快的行内补全和更广泛的模型灵活性,适合日常开发和小幅修改。两者的选择取决于工…

  18. TOOL · CL_169732 ·

    大型语言模型注意力模式与自动程序修复成功率相关

    一项新的实证研究调查了大型语言模型(LLMs)如何处理用于自动程序修复的错误报告。研究人员分析了来自SWE-bench Verified和Multi-SWE-bench的319个Python和Java错误的LLMs注意力模式。研究发现,成功的修复通常涉及跨越错误报告的各个组成部分(如描述和堆栈跟踪)的扩散注意力,而失败的修复则倾向于过度集中于元数据(如版本信息)上。这项研究首次证明了注意力分配不当是基于LLM的自动程序修复失败的一个重…

  19. TOOL · CL_169474 ·

    Alaya Token集成Kimi K3,全球首个3T开源模型

    DataCanvas旗下的Alaya Token平台已集成Kimi K3,这是全球首个开源的3万亿参数模型。此次集成使用户能够通过Alaya Token的统一服务来访问Kimi K3的先进能力,包括其百万级token上下文窗口以及在编码和推理基准测试中的强大性能。该平台旨在提供可扩展的、按需的token计算能力,从而为企业应用实现各种领先的开源模型之间的无缝切换。

  20. RESEARCH · CL_171855 ·

    MindForge 管道训练小型 LLM 完成软件工程全生命周期

    研究人员开发了 MindForge,这是一个旨在训练小型语言模型执行全面软件工程任务的自动化管道。该系统将开源命令行程序转换为无源代码的训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成程序轨迹上微调 Qwen3.6-27B 模型,研究人员显著提高了其在 ProgramBench 基准测试上的性能,取得了与大型前沿模型相当的结果。微调后的模型在各种未见过的软件工程任务中也表现出广泛的改进,包括代码生成、错误修…