PulseAugur
实时 08:10:17
实体 Deepsweg

Deepsweg

PulseAugur coverage of Deepsweg — every cluster mentioning Deepsweg across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
18
90 天内 42
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 17
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-28 research_milestone Datacurve's new DeepSWE benchmark ranks GPT-5.5 as the top AI model for coding tasks. 来源
  2. 2026-05-27 research_milestone A new benchmark, DeepSWE, was released, showing GPT-5.5 outperforming Claude Opus in realistic coding tasks. 来源
情绪 · 30 天

11 天有情绪数据

LAB BRAIN
hypothesis resolved contradicted 置信度 0.55

New, more reliable AI coding benchmark to emerge within 60 days

Given the widespread issues and criticism surrounding DeepSWE, it is plausible that a new, more robust benchmark will be developed and announced within the next 60 days to address the identified flaws and provide a more accurate evaluation of AI coding models.

observation resolved confirmed 置信度 0.85

DeepSWE benchmark facing widespread criticism for execution flaws

Multiple recent clusters indicate significant criticism of the DeepSWE benchmark due to flawed execution and reliability concerns. This suggests that the benchmark's results may not be trustworthy, impacting the evaluation of AI coding assistants and potentially misleading Staff+ buyers who rely on these metrics.

observation expired 置信度 0.70

Programming language impacts AI coding model performance on DeepSWE

User reports analyzing DeepSWE benchmark data indicate that the choice of programming language significantly affects the performance of AI coding models. This suggests that future evaluations and comparisons of these models should consider language-specific strengths and weaknesses.

hypothesis resolved confirmed 置信度 0.55

A more robust AI coding benchmark will be released within 60 days to address DeepSWE's shortcomings

The recent discovery of significant flaws in the DeepSWE benchmark, coupled with the development of DeepSWE as a replacement for SWE-bench, indicates a pattern of evolving evaluation methods. Given the critical need for accurate AI coding assistant performance metrics, it is likely that another, more robust benchmark will emerge soon to address the identified issues.

observation resolved contradicted 置信度 0.65

Programming language choice significantly impacts AI coding model performance on DeepSWE

User reports analyzing DeepSWE benchmark data indicate that the choice of programming language has a notable effect on AI model performance. Models like GPT 5.5 and Mimo V2.5 Pro show varying strengths across languages such as Rust and TypeScript, suggesting that evaluations should consider language-specific capabilities rather than a monolithic score.

查看全部假设 →

最近 · 第 1/3 页 · 共 42 条
  1. TOOL · CL_171855 ·

    MindForge 管道训练小型 LLM 进行全周期软件工程

    研究人员开发了 MindForge,一个旨在训练小型语言模型进行全面软件工程任务的新型管道。该系统将开源命令行程序转换为无源码训练环境,仅提供编译后的可执行文件和文档。通过在 GLM-5.2 生成的合成数据上微调 Qwen3.6-27B 模型,研究人员显著提高了其生成完整程序的能力,达到了与更大规模前沿模型相当的性能水平。

  2. SIGNIFICANT · CL_162676 ·

    Google 发布更便宜的 Gemini Flash 模型,优先考虑成本而非巅峰性能

    Google 发布了三款新的 Gemini Flash 模型——3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber——专注于大规模 AI 代理的成本效益。与早期版本相比,3.6 Flash 模型减少了输出 token 消耗并降低了价格,在各种基准测试中表现有所提高。虽然这些模型优先考虑效率和成本降低,但 Google 承认其旗舰 Gemini 3.5 Pro 仍处于合作伙伴测试阶段,而 Gemini …

  3. TOOL · CL_162175 ·

    Moonshot AI 的 K3 模型在 Together 平台上线

    Moonshot AI 的 K3 模型已在 Together 平台提供。此次发布使 K3 成为推理领域的一个有竞争力的选项,特别是在编码任务方面,据报道其在 pass@k 指标上优于 Claude Fable-5,且成本更低。该平台旨在为用户提供个性化时间线和高效的 AI 解决方案。

  4. FRONTIER RELEASE · CL_162005 ·

    Anthropic 发布 Opus 5,以一半价格匹配 Fable 5 性能 · 跟踪 10 个来源

    Anthropic 发布了其新 AI 模型 Claude Opus 5,其性能可与更高级的 Fable 5 模型相媲美,但成本减半。该新模型专为日常业务需求而设计,包括编码和知识工作,并具有用户可选择的成本与能力切换器。虽然 Opus 5 在性能上比其前身 Opus 4.8 以及 OpenAI 的 GPT-5.6 "Sol" 等竞争对手有所迭代改进,但它并未带来能力的根本性飞跃,尤其是在网络安全等专业领域,其安全防护比 Opus 4.…

  5. SIGNIFICANT · CL_160572 ·

    Together AI 的 Kimi K3 Max 在软件任务上以更低的成本媲美 GPT-5.6 Sol Max

    Together AI 发布了 Kimi K3 Max,该模型在软件工程任务上的表现与 GPT-5.6 Sol Max 相当,但成本显著降低。Kimi K3 Max 与 GPT-5.6 Sol Max 结合使用时,可实现显著的 16% 性能提升。

  6. TOOL · CL_158115 ·

    Kimi K3 Max 在编码任务的性价比上可与 GPT-5.6 Sol Max 相媲美

    Together AI 发布了一项分析,将其 Kimi K3 Max 模型与 OpenAI 的 GPT-5.6 Sol Max 在软件工程任务上进行了比较。研究结果表明,Kimi K3 Max 的表现与 GPT-5.6 Sol Max 相当,但成本显著更低。此外,当两者结合使用时,共同展示了约 16% 的显著性能提升。

  7. TOOL · CL_158045 ·

    Google Gemini 3.5 Pro 在 Flash 模型发布之际面临第三次延迟

    Google 近期发布的 Gemini 3.6 Flash,其特点是改进了编码基准性能并降低了价格,似乎是一种权宜之计。旗舰模型 Gemini 3.5 Pro 自 5 月份在 Google I/O 上首次发布以来,已多次延迟发布,该模型旨在与 Anthropic 的 Claude 3.5 Opus 和 OpenAI 的 GPT-5 竞争。这种持续的延迟表明 Google 的 AI 开发存在更深层次的结构性问题,可能影响其竞争地位。

  8. TOOL · CL_155890 ·

    Together AI 的 Kimi K3 以更低的成本实现了与 Claude Fable-5 相当的性能

    Together AI 发布了基准测试结果,将其 Kimi K3 模型与 Anthropic 的 Claude Fable-5 在软件工程任务上进行了比较。使用 DeepSWE 进行的分析表明,Kimi K3 的性能与 Claude Fable-5 相当,但成本约为其 35%。此外,据报道,Kimi K3 在更高的 pass@k 指标上表现优于 Claude Fable-5。

  9. SIGNIFICANT · CL_155809 ·

    Poolside AI 发布 Laguna S 2.1,一款拥有 1M 上下文的紧凑型编码模型

    Poolside AI 发布了 Laguna S 2.1,这是一款拥有 118B 参数的混合专家模型,其中 8B 参数被激活,并拥有 1M token 的上下文窗口。该模型在不到九周的时间内开发完成,在长时程编码基准测试中表现强劲,在同级别模型中超越了体积大其数倍的模型。Laguna S 2.1 在 Terminal-Bench 2.1 上获得了 70.2% 的分数,在 DeepSWE v1.1 上获得了 40.4% 的分数,所有评估…

  10. SIGNIFICANT · CL_165661 ·

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 推出了三款新的 Gemini 模型:3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。3.6 Flash 模型在性能上优于其前身 3.5 Flash,提高了代币效率,并减少了输出代币使用量,降低了 AI 代理工作流的成本。3.5 Flash-Lite 专为最大速度和成本效益而设计,而 3.5 Flash Cyber 在与 CodeMender 代理配对时,则专用于网络…

  11. TOOL · CL_149383 ·

    Together AI 的 Kimi K3 以更低的成本媲美 Claude Fable 5 的性能

    Together AI 发布了一项分析,将其 Kimi K3 模型与 Anthropic 的 Claude Fable 5 在软件工程任务上进行了比较。研究结果表明,Kimi K3 的性能与 Claude Fable 5 相当,但成本显著降低,约为 Claude Fable 5 的 65%。此外,据报道,在更高的 pass@k 指标上,Kimi K3 的表现优于 Claude Fable 5。

  12. TOOL · CL_135477 ·

    DeepSWE 基准测试揭示编码任务中巨大的性能差异

    DeepSWE 基准测试的比较图显示出显著的性能差距,其中一个模型在性能上远远优于其他模型。该图表因其鲜明的对比结果而被视为“NSFW”,突显了在编码任务中的主导性表现。

  13. TOOL · CL_135004 ·

    DeepSWE 基准测试加入 GPT-5.6 模型,挑战 Claude Code

    一个新的基准测试 DeepSWE 已被引入,其中包含 GPT-5.6 模型。该基准测试因其包含的图形内容而被标记为 NSFW。这一发展表明 Claude Code 可能不会继续作为唯一的占主导地位的编码代理。

  14. COMMENTARY · CL_136670 ·

    GPT-5.6 Luna MAX 在 DeepSWE 基准测试中表现强劲

    一位 Reddit 用户分享了一个名为 DeepSWE 的基准测试结果,声称 GPT-5.6 Luna MAX 在此测试中表现出色。该用户注意到不同努力级别在该基准测试中存在异常大的差异,暗示该模型版本可能存在异常或独特之处。另一篇 Reddit 帖子也提到了 GPT-5.6 相关的 DeepSWE 基准测试,表明社区对其性能感兴趣。

  15. FRONTIER RELEASE · CL_130110 ·

    GPT-5.6 在基准测试中挑战 Fable 5,但长任务可靠性存疑 · 追踪 8 个来源

    据报道,OpenAI 已发布 GPT-5.6,将其定位为 Anthropic 的 Claude Fable 5 的竞争对手。虽然 GPT-5.6 Sol 在聚合基准测试中表现强劲且价格显著更低,但 Fable 5 在处理长而复杂的任务和代理工作流方面表现更优。早期报告表明,GPT-5.6 在任务连续性和异常推理模式方面可能存在困难,尽管基准分数具有竞争力,但可能导致输出不准确或无意义。关于 GPT-5.6 的成本效益和速度是否能抵消 …

  16. SIGNIFICANT · CL_129683 ·

    Tencent 发布 Hy3,一个开放的 295B MoE 模型,支持 256K 上下文

    Tencent 发布了 Hy3,一个开源的 2950 亿参数专家混合(MoE)模型,专为复杂推理、代理工作流和长上下文任务而设计。该模型每个 token 只激活 210 亿参数,在保持效率的同时支持 256K 的上下文窗口。Hy3 在编码、STEM 和推理任务等各种基准测试中表现出色,并经过特定训练以提高工具调用中的可靠性、减少幻觉并增强多轮意图跟踪。该模型可通过兼容 OpenAI 的 API 访问,并提供 `reasoning_ef…

  17. COMMENTARY · CL_125780 ·

    LLM 在性能与成本方面的评估,并延伸至人类和公司的效率

    近期对大型语言模型(LLM)的评估侧重于相对于资源支出的性能,并以帕累托前沿的形式进行可视化。Multi Select Virology Troubleshooting 和 DeepSWE 等基准测试图表表明,虽然性能随成本增加而提高,但在更高的代币数量下收益会递减。这种效率的概念也被应用于人类和公司的绩效,表明优化资源使用是提高能力的关键。

  18. TOOL · CL_122747 ·

    Together AI:GLM-5.2 的能力达到 Sonnet 5 的 80%,价格仅为其 20%

    Together AI 发布了一项分析,将他们的 GLM-5.2 模型与 Anthropic 的 Sonnet 5 在软件工程任务上进行了比较。研究结果表明,GLM-5.2 的能力约为 Sonnet 5 的 80%,而成本仅为后者的 20% 左右。该比较使用了 DeepSWE 基准测试,重点关注在 113 个原始的长周期软件工程问题中需要最大推理能力的任务。

  19. TOOL · CL_107609 ·

    DeepSWE基准测试提供无污染的AI编码能力评估

    一项名为DeepSWE的新基准测试已被开发出来,以更准确地评估前沿AI模型的编码能力。与之前的基准测试不同,DeepSWE是无污染的,其任务是从头开始创建的,以避免模型在预训练期间看到解决方案。它在91个代码库和五种语言中具有高度多样性,通过更长的解决方案和比现有基准测试更多的输出令牌来呈现真实世界的复杂性。该基准测试还采用可靠的手写验证器来测试软件行为,旨在反映软件工程任务中的实际性能。

  20. RESEARCH · CL_102096 ·

    Anthropic的Fable 5在禁令期间位居编码基准榜首;Shazeer加入OpenAI;SpaceX拟以600亿美元收购Cursor

    Anthropic的Claude Fable 5因美国政府禁令仍处于离线状态,谈判正在进行中,拟议的英国豁免未能成功。尽管无法使用,Fable 5已在AI编码的DeepSWE基准测试中取得领先地位。在一项重要人才流动中,Transformer架构联合创始人Noam Shazeer已离开Google加入OpenAI,担任架构研究主管,此举预计将影响Google的Gemini路线图。此外,SpaceX已提交一项全股票收购AI编码平台Cur…