Deepsweg
PulseAugur coverage of Deepsweg — every cluster mentioning Deepsweg across labs, papers, and developer communities, ranked by signal.
- developed Gemini 3.6 Flash 95%
- instance of Gemini 3.6 Flash 95%
- developed by Opus 4.8 90%
- competes with Claude Fable-5 80%
- competes with An Ape and a Fox 80%
- competes with GPT 5.6 "Sol" 70%
- competes with Kimi k3 70%
- used by GLM 5.3 70%
- used by GLM-5.2 70%
- competes with Mythos 5 70%
- used by Claude Fable-5 70%
- instance of GLM-5.2 70%
10 天有情绪数据
New, more reliable AI coding benchmark to emerge within 60 days
Given the widespread issues and criticism surrounding DeepSWE, it is plausible that a new, more robust benchmark will be developed and announced within the next 60 days to address the identified flaws and provide a more accurate evaluation of AI coding models.
DeepSWE benchmark facing widespread criticism for execution flaws
Multiple recent clusters indicate significant criticism of the DeepSWE benchmark due to flawed execution and reliability concerns. This suggests that the benchmark's results may not be trustworthy, impacting the evaluation of AI coding assistants and potentially misleading Staff+ buyers who rely on these metrics.
Programming language impacts AI coding model performance on DeepSWE
User reports analyzing DeepSWE benchmark data indicate that the choice of programming language significantly affects the performance of AI coding models. This suggests that future evaluations and comparisons of these models should consider language-specific strengths and weaknesses.
A more robust AI coding benchmark will be released within 60 days to address DeepSWE's shortcomings
The recent discovery of significant flaws in the DeepSWE benchmark, coupled with the development of DeepSWE as a replacement for SWE-bench, indicates a pattern of evolving evaluation methods. Given the critical need for accurate AI coding assistant performance metrics, it is likely that another, more robust benchmark will emerge soon to address the identified issues.
Programming language choice significantly impacts AI coding model performance on DeepSWE
User reports analyzing DeepSWE benchmark data indicate that the choice of programming language has a notable effect on AI model performance. Models like GPT 5.5 and Mimo V2.5 Pro show varying strengths across languages such as Rust and TypeScript, suggesting that evaluations should consider language-specific capabilities rather than a monolithic score.
-
新的量子-经典混合人工智能架构提升长时推理能力
研究人员推出了一种新颖的量子-经典混合架构QART,旨在提高人工智能模型在长时推理方面的能力。QART集成了骨干语言模型与量子编码、优化和解码技术,以减轻早期错误的影响。使用DeepSeek V4 Flash、GLM-5.3和GPT-5.5等模型在六个基准测试上的初步测试表明,在大多数配置下,QART的表现优于骨干模型,在与编码相关的任务上取得了显著的提升。
-
Together AI 概述迁移到开源模型的策略
Together AI 的博客文章概述了从闭源迁移到开源 AI 模型的策略,强调此类迁移可以比传统迁移更快、更简单,尤其是在利用托管服务时。该过程涉及定义特定的用例和工作负载,以识别相关的基准和候选模型。关键评估标准不仅包括排行榜上的原始性能指标,还包括每项任务的成本、令牌使用量、运行时以及验证正确答案的能力。文章还强调了在沙盒环境中进行实际测试以评估模型行为和故障模式的重要性。
-
Fireworks 发布 DeepSeek-V4.1-Flash,用于高性价比的 AI 任务
Fireworks 发布了 DeepSeek-V4.1-Flash 模型,据报道该模型在性能和成本效益方面为 AI 任务(尤其是在软件工程领域)开辟了新天地。在 DeepSWE 基准测试中,该模型的准确性与 GPT-6 Astra 等模型相当,但每项任务的成本却大大降低。这种成本降低归因于新的编码器-解码器拆分架构和优化的 KV 缓存,使得复杂代理工作流能够更经济地获得先进的 AI 功能。
-
DeepSeek 发布 V4.1 Flash,采用高效 MoE 架构
DeepSeek 已正式发布其 V4.1 Flash 模型,这是一个拥有 5520 亿参数的混合专家(MoE)模型,采用了因果编码器-解码器(CED)架构和原生多模态能力。该新模型旨在提高效率,在推理过程中仅激活其一小部分参数,从而显著降低长上下文和代理工作负载的成本。据报道,V4.1 Flash 在多项基准测试中表现优于 GPT 5.6 "Sol" 和 Anthropic 的 Opus 5 等先前模型,尤其是在代理任务方面,同时大幅…
-
减少LLM幻觉的方法可能会损害代码生成能力
一种新方法提出禁用大型语言模型中的特定神经元,以显著减少或消除幻觉。虽然这种技术在提高事实准确性方面很有效,但它可能会“残废”LLM的某些部分,从而可能影响其生成复杂代码的能力。该方法在DeepSWE等编码基准测试上的有效性是开发人员面临的一个关键问题。
-
Together AI 发布 GLM-5.3 Flash,一款高性价比的多模态大模型
Together AI 发布了 GLM-5.3 Flash,这是一款原生多模态模型,拥有 3200 亿参数和 100 万 token 的上下文窗口。该模型是 GLM-5.3 的蒸馏版本,在保持 DeepSWE 等基准测试竞争力的同时,显著降低了成本并加快了推理速度。Perplexity 已将 GLM 5.3 集成到其 Perplexity Computer 服务中,突显了其在长上下文、多模态代理工作负载方面的能力。
-
Together AI 的 GLM-5.3 在效率基准测试中优于 Fable 5
Together AI 的 GLM-5.3 模型在效率方面明显优于 Fable 5,在相同的 100 美元预算下,其完成的工作量是 Fable 5 的五倍以上。在 DeepSWE 基准测试中,GLM-5.3 解决了约 17 个任务,而 Fable 5 只解决了 3 个,尽管在初步尝试时性能相似。
-
Together 的 GLM-5.3 在 DeepSWE 基准测试中优于 Fable 5
Together 的 GLM-5.3 模型在 DeepSWE 基准测试中表现优于 Anthropic 的 Fable 5。在测试中,GLM-5.3 的解决率为 87.6%,成本约为 16 美元,显著优于 Fable 5 的解决率 69.7%,后者成本为 21.63 美元。
-
GLM-5.3 在编码任务上挑战 GPT-5.6 Sol 和 Claude Fable 5
Together AI 在 DeepSWE 软件工程任务上对其 GLM-5.3 模型与 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5 进行了基准测试。GLM-5.3 表现出竞争力,在单次准确率上略微落后于 GPT-5.6 Sol,但在多次尝试和显著更低的成本下超越了它。与 Claude Fable 5 相比,GLM-5.3 在准确率上相当,但成本却低了五倍多,两种模型都表现出相似的…
-
Unsloth 发布 Qwen3.8-27B 的 Dynamic v3 量化版本,准确性得到提升
Unsloth 发布了 Qwen3.8-27B GGUFs 的 Dynamic v3.0 量化版本,与其他提供商相比,在相同模型大小下准确性提高了 10% 以上。新版本采用改进的方法,使用更高质量的 imatrix 校准数据集和增强的量化技术,同时避免了 QAT 或 QAD。该版本包括保留显著准确性且体积更小的 1 位量化版本,非常适合内存有限的系统。
-
Ornith AI 发布 Ornith-1.5 模型系列,专注于自我改进
Ornith AI 发布了 Ornith-1.5 模型系列,其中包括一个 9B 的密集模型以及 35B 和 397B 的混合专家(MoE)变体。这些模型旨在实现自我改进,并在推理、编码和代理任务等各种基准测试中表现出与 Claude Opus 4.8 等成熟模型相媲美的性能。这些模型可在 Hugging Face 上获取,并兼容 Transformers、llama.cpp、vLLM 和 SGLang 等流行推理工具,并提供了集成说明。
-
DeepSeek V4 Pro发布,多项编码能力挑战Fable 5 · 追踪2个来源
DeepSeek 已正式发布其 V4 Pro 模型,这是其开源 AI 产品的一项重大进展。该新模型在智能体编码任务方面表现出色,在多项基准测试中可与 Fable 5 和 Anthropic 的 Claude Opus 4.8 等领先模型相媲美甚至超越。尽管 V4 Pro 模型功能强大且定价具有竞争力,但目前缺乏视觉支持,并且用户注意到其推理输出有所变化,这可能会影响创意写作任务。
-
DeepSeek V4 Pro 0813 发布,在成本和能力上展开竞争
DeepSeek 发布了其 V4 Pro 0813 模型,这是一个增强版本,具有改进的代理能力和性能,尤其适用于生产环境。该模型现已在 Hugging Face 和 Together AI 等平台上提供。基准测试表明,与 GPT-5.6 Sol 和 Claude Fable 5 等领先的专有模型相比,DeepSeek V4 Pro 0813 在软件工程任务上提供了具有竞争力的性能,尤其是在成本效益方面。
-
Terra Max 对比 Luna Max:用户质疑成本效益和性能差异
一位 Reddit 用户正在询问两种 AI 模型 Terra Max 和 Luna Max 在 DeepSWE 基准测试中的差异和价值主张。用户质疑为什么在 Terra Max 成本较低且任务完成率仅有微小差异的情况下,会选择 Terra Max 而不是 Luna Max。他们正在寻求用户体验和关于 Terra Max 潜在优势的澄清,例如在长远任务中的表现。
-
Mini-SWE-agent 在调试基准测试中表现出潜力,使用的 token 比 GPT-5.6 少
一位用户进行了一项基准测试,将 mini-swe-agent 与 GPT-5.6 "Sol" 进行了调试任务的比较。mini-swe-agent,特别是当使用 "bash + linear history" 设置时,其通过率显著提高,并且使用的 token 比 Codex CLI High 少。尽管承认单个基准测试切片的局限性,但用户认为这些结果对于日常 bug 修复很有希望,并寻求社区对该工具的使用经验。
-
DeepSeek-V4 Flash 以成本效益挑战 GPT-5.6 Luna 编码基准
Together AI 发布了对 DeepSeek-V4 Flash 和 GPT-5.6 Luna 在 DeepSWE 编码基准上的对比分析。虽然 GPT-5.6 Luna 在所有质量指标上都表现出卓越的性能,但 DeepSeek-V4 Flash 被证明具有显著的成本效益。分析表明,采用级联方法,优先使用 DeepSeek-V4 Flash,仅在必要时升级到 GPT-5.6 Luna,可以以比单独使用 GPT-5.6 Luna 更低…
-
Kimi K3 在 DeepSWE 基准测试中表现优于 GPT-5.6 "Sol"
Together AI 发布了一项分析,在 DeepSWE 基准测试中将其 Kimi K3 模型与 GPT-5.6 "Sol" 进行了比较。研究发现,采用 Kimi 优先的级联策略(包括测试套件验证)比单独使用 GPT-5.6 "Sol" 取得了更好的结果,并且每完成一项任务的成本效益更高。
-
Bespoke Labs 寻求研究员开发长期代理基准
Bespoke Labs 正在寻找一名研究员,为长期代理任务开发和评估强化学习环境和基准。该职位要求具备多步推理代理的实践经验,特别是提及对 SWE-bench 和 Gymnasium 等环境的贡献。该职位为远程合同,申请将根据长期代理工作的具体证据进行筛选。
-
阿里巴巴的Qwen在Text Arena排行榜上名列第二
阿里巴巴的Qwen模型在Text Arena排行榜上取得了第二名的成绩。这一排名突显了该模型在与其他AI系统的比较评估中的表现。
-
清华大学发布 VeriLoop Coder-E1 用于可验证的代码修复
清华大学的研究人员开源了 VeriLoop Coder-E1,这是一个用于可验证递归自改进以进行代码修复的模型。VeriLoop Coder-E1 基于 Qwen3.6-27B 架构构建,采用“基于证据的螺旋式”方法来增强其代码修复能力。该模型在 SWE-bench Verified、SWE-bench Pro、Terminal-Bench 2.0 和 DeepSWE 等多个基准测试中表现强劲,尤其是在采用窄域 PEFT 和 Self…