PulseAugur
中
实时 21:45:19
实体 DeepSWE v1.1

DeepSWE v1.1

PulseAugur coverage of DeepSWE v1.1 — every cluster mentioning DeepSWE v1.1 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
5
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. SIGNIFICANT · CL_269859 ·

    OpenAI 的 GPT-6.1 Sol 在 Amazon Bedrock 上推出,增强了推理能力

    OpenAI 的 GPT-6.1 Sol 模型现已在 Amazon Bedrock 上可用,为编码、计算机使用和专业任务提供增强的推理能力。这个新版本是 GPT-6 Sol 的重大升级,在 DeepSWE v1.1 基准测试中的表现与 GPT-6 Astra 相当,但成本却大大降低。GPT-6.1 Sol 旨在通过更好地理解复杂文档、有效利用工具以及识别局限性来改进代理工作流程,从而减少错误和人工干预。

  2. RESEARCH · CL_252313 ·

    DeepSeek 的 V4.1 Flash 模型提供速度和低成本,但市场份额增长缓慢

    DeepSeek 发布了其 V4.1 Flash 模型,这是一个拥有 552B 参数的专家混合(Mixture-of-Experts)模型,该模型速度惊人,并且 KV 缓存大小显著减小,使其成为最便宜的前沿模型之一。尽管该模型在各种基准测试中表现出色,并且采用了激进的定价策略,但它似乎在市场采用方面遇到了困难,与 OpenAI 等成熟的竞争对手相比,其 API 使用量仅占很小一部分。这种差距凸显了开发人员对尖端、经济高效的模型感兴趣,…

  3. SIGNIFICANT · CL_244142 ·

    Google 和 Meta 发布新的专注于编码的 AI 模型

    Google 和 Meta 分别发布了新的专注于编码的 AI 模型 Gemini 3.8 Flash 和 Muse Spark 1.3。这些模型旨在以低于旗舰模型的价格,处理大批量编码和代理任务。Gemini 3.8 Flash 在软件工程和命令行任务上表现强劲,而 Muse Spark 1.3 在银行和终端操作方面有了显著改进,但它仍然是一个专有的仅限 API 的模型。

  4. FRONTIER RELEASE · CL_232481 ·

    Google DeepMind 发布 Gemini 3.8 Flash 和 Cyber 版本

    Google DeepMind 发布了其 Gemini 模型的新两个版本:Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。Gemini 3.8 Flash 在速度和成本与前代 Gemini 3.7 Flash 相同的情况下,提供了更强的推理和编码能力,适用于通用企业用途和自主代理。Gemini 3.8 Flash Cyber 专为网络安全任务设计,在漏洞检测和自动化修复方面展现了前沿水平的性能,并通…

  5. TOOL · CL_226646 ·

    新的Agentic Coding Index根据智能密度对大型语言模型进行排名

    一位Reddit用户开发了一种名为Agentic Coding Index (ACI)的新指标,用于评估大型语言模型(LLM)在编码任务上的表现。ACI使用加权公式汇总了SWE-bench Pro、DeepSWE v1.1和Terminal-Bench等多个编码基准测试的得分。该指标旨在通过考虑模型的参数数量及其在这些多样化编码评估中的表现来衡量模型的“智能密度”,重点在于奖励真正的自主掌握能力。

  6. TOOL · CL_214214 ·

    Google Gemini 3.7 Flash 为智能体和编码任务削减价格

    Google 发布了 Gemini 3.7 Flash,一款专为编码和智能体任务设计的新模型,在12月31日前享有50%的 introductory 价格优惠。该新模型在与智能体工作相关的基准测试中表现出显著改进,例如 DeepSWE v1.1 和 Zapier's AutomationBench。降低的价格使 Gemini 3.7 Flash 跻身于与其他经济高效模型并列的竞争性中端市场,鼓励开发者考虑其在智能体工作负载中的能力。

  7. RESEARCH · CL_209233 ·

    Google 快速迭代 Gemini Flash 模型以应对专业编码任务

    Google 在 12 周内迅速发布了其 Gemini Flash 模型的三个迭代版本,每个版本都针对特定改进。5 月份推出的 Gemini 3.5 Flash 提供了高速性能。随后在 7 月份推出了 Gemini 3.6 Flash,专注于优化 token 使用并降低成本。最新发布的 Gemini 3.7 Flash(8 月份)增强了推理和多步规划能力,在 DeepSWE v1.1 和 FrontierCode 1.1 Main 等…

  8. FRONTIER RELEASE · CL_199067 ·

    Google 发布 Gemini 3.7 Flash,性能大幅提升且价格下调 · 跟踪 9 个来源

    Google 发布了 Gemini 3.7 Flash,这是其用于编码和 AI 代理的旗舰模型的最新版本,距离前代 Gemini 3.6 Flash 发布仅三周。此次更新在软件工程、知识工作和 Web 开发方面提供了显著的性能改进,在编码准确性和复杂文档处理方面取得了显著进展。Gemini 3.7 Flash 的推出价格也比其前代产品低一半,旨在为开发人员和客户提供具有成本效益的扩展。新模型已集成到 Gemini Spark 中,增强…

  9. FRONTIER RELEASE · CL_160596 ·

    Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源

    Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。

  10. COMMENTARY · CL_106105 ·

    OpenAI助力罕见病诊断;Anthropic暂停智能体SDK计费变更 · 跟踪1个来源

    今日AI新闻涵盖了一系列进展,包括OpenAI将AI应用于罕见病诊断、Anthropic决定暂停其Claude Agent SDK一项有争议的计费变更,以及DeepSWE v1.1在编码智能体基准测试方面的进展。新闻还强调了中国对本土AI模型栈的持续投资,华为利用本土硬件进行模型优化。