PulseAugur
实时 08:20:21
实体 Qwen3.7 Max

Qwen3.7 Max

PulseAugur coverage of Qwen3.7 Max — every cluster mentioning Qwen3.7 Max across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 40
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-28 product_launch Alibaba launched Qwen3.7-Max, an agent-first LLM with a 1 million token context window. 来源
  2. 2026-05-28 research_milestone Qwen3.7-Max achieved the third position on the ITBench-AA benchmark for enterprise IT tasks. 来源
  3. 2026-05-27 product_launch Alibaba's Qwen team released the Qwen3.7 Max model via API. 来源
  4. 2026-05-26 research_milestone Alibaba's Qwen3.7-Max achieved a second-place ranking on the Code Arena programming leaderboard. 来源
  5. 2026-05-25 research_milestone Qwen3.7-Max model introduces implicit caching.
  6. 2026-05-23 product_launch Alibaba released its new AI model, Qwen3.7-Max, capable of long-running autonomous tasks. 来源
  7. 2026-05-22 product_launch Alibaba released the Qwen3.7-Max model with 1 million token context and agentic capabilities. 来源
  8. 2026-05-21 research_milestone Qwen3.7-Max achieved a score of 56.6 on the Artificial Analysis Intelligence Index. 来源
  9. 2026-05-21 product_launch Alibaba's Qwen team released their latest flagship model, Qwen3.7-Max.
  10. 2026-05-21 research_milestone Alibaba's Qwen3.7-Max model achieved the highest score among Chinese LLMs and ranked fifth globally. 来源
  11. 2026-05-21 research_milestone Alibaba's Qwen3.7-Max model achieved a top-five global ranking and first in China on a new large model leaderboard.
  12. 2026-05-21 research_milestone Alibaba's Qwen3.7-Max achieved a top ranking in a global large language model benchmark. 来源
  13. 2026-05-21 research_milestone Alibaba's Qwen3.7-Max achieved a top global ranking and the highest rank for a Chinese model in the latest Artificial Analysis benchmark.
  14. 2026-05-21 product_launch Alibaba's Qwen3.7-Max model was released and ranked globally.
  15. 2026-05-20 product_launch Alibaba Cloud launched its new flagship large language model, Qwen3.7-Max. 来源
情绪 · 30 天

2 天有情绪数据

LAB BRAIN
hypothesis resolved confirmed 置信度 0.55

Qwen3.7-Max to demonstrate improved SRE capabilities on ITBench-AA

Given Qwen3.7-Max's stated focus on agentic tasks and its demonstrated ability to self-optimize code for new hardware, it is plausible that Alibaba will release benchmarks showing Qwen3.7-Max performing significantly better than other frontier models on the new ITBench-AA, particularly in root-cause analysis for Kubernetes incidents.

observation resolved confirmed 置信度 0.80

Qwen3.7-Max exhibits prolonged autonomous operation and hardware adaptation

Multiple clusters indicate Qwen3.7-Max can operate autonomously for extended periods (up to 35 hours) and has demonstrated a remarkable ability to self-optimize code for unknown hardware architectures, achieving significant performance gains (10x). This suggests a strong focus on agentic capabilities and hardware-aware AI.

hypothesis resolved confirmed 置信度 0.50

Alibaba to release Qwen3.7-Max-powered enterprise agent solutions within 90 days

The release of Qwen3.7-Max, positioned as targeting the 'agent frontier' and demonstrating autonomous operation and self-optimization, suggests Alibaba is preparing to commercialize these capabilities. We hypothesize that Alibaba will announce specific enterprise agent solutions leveraging Qwen3.7-Max within the next 90 days.

查看全部假设 →

最近 · 第 1/2 页 · 共 40 条
  1. TOOL · CL_183836 ·

    新工具扫描代码中即将退役的 AI 模型,以防止 CI 故障

    一款名为 AI Model Watch 的新工具已被开发出来,旨在帮助开发人员主动管理其项目中使用的 AI 模型生命周期。该工具扫描代码库中硬编码的模型 ID,并将其与模型退役日期目录进行比对。此举旨在防止模型被弃用或退役时 CI/CD 流水线意外失败,这是一个常见问题,因为 Anthropic、OpenAI 和 Google 等提供商通常只向账户所有者发送弃用通知,而不会直接发送给开发团队。AI Model Watch 可识别即将达…

  2. TOOL · CL_171624 ·

    开发者通过使用多模型路由将AI API账单削减97%

    一位开发者通过实施三层模型路由策略,显著降低了其AI API成本。他们不再为所有任务使用GPT-5.6 Sol或Claude Sonnet 5等昂贵的尖端模型,而是将简单的请求路由到DeepSeek V4-Flash和Qwen3.7-Max等更具成本效益的模型。这一策略借鉴了AI.cc关于模型价格下降和开源模型兴起的2026年报告的见解,将他们的月度账单从3000多美元削减至87美元。该策略将任务分为简单、中等和复杂三个层级,并为每个…

  3. RESEARCH · CL_162502 ·

    阿里巴巴将Qwen旗舰模型转为仅限API访问

    阿里巴巴已将其旗舰Qwen模型转向仅限API的策略,于2026年2月发布的Qwen3.5-397B-A17B将是最后一个提供Apache 2.0许可下公开可用权重的模型。后续模型,如Qwen3.7-Max,只能通过API访问,这反映了阿里巴巴对其AI资产货币化的日益关注。这一战略转变发生在2026年初Qwen团队关键人员离职以及旨在从AI产品中创收的企业重组之后。

  4. RESEARCH · CL_161332 ·

    DeepSeek 永久性地将 V4-Pro 模型价格下调 75%

    DeepSeek 已将其 V4-Pro 模型 75% 的促销折扣永久化,大幅降低了其旗舰 AI 模型的成本。每百万个输入 token 的价格现为 0.435 美元,低于之前的 1.74 美元;每百万个输出 token 的价格为 0.87 美元,低于之前的 3.48 美元。此外,访问上下文缓存的成本降低了 120 倍,使得具有相似前缀的重复查询成本显著降低。

  5. RESEARCH · CL_157848 ·

    研究发现:AI 实验室并未“玩弄”‘骑自行车的鹈鹕’基准测试

    进行了一项实验,以确定 AI 实验室是否正在为其模型优化一个特定的非正式基准测试:生成一辆骑自行车的鹈鹕的 SVG。该研究测试了包括 GPT-5.6 Terra 和 Claude Sonnet 5 在内的七个前沿模型,通过生成各种动物-车辆组合的 1008 个 SVG。使用 LLM 裁判和 Gemini 3.1 Flash-Lite 分析的结果表明,实验室并未专门对其模型进行“鹈鹕最大化”,因为在测试模型中,骑自行车的鹈鹕提示的表现并…

  6. TOOL · CL_157029 ·

    OpenCodex支持在OpenAI Codex中进行多模型选择

    一款名为OpenCodex的新工具已被开发出来,允许用户在OpenAI Codex环境中集成多个大型语言模型。这种设置使用户能够为特定的编码任务选择最合适的模型,而不是局限于单一模型。该工具充当代理,将Codex的API流量转换为Chat Completions,并将其路由到Claude Opus 4.8、Grok 4.5和Kimi K3等各种模型。这种灵活性旨在通过将任务与最适合、可能最快或最便宜的可用模型相匹配来优化性能和成本。

  7. SIGNIFICANT · CL_156977 ·

    百度文心一言代理登顶全球智能基准测试,超越Claude和GPT

    百度文心一言任务代理已在国际PinchBench v2排行榜上名列前茅,超越了Anthropic的Claude Opus 4.8和OpenAI的GPT-5.6-luna等模型。该代理的最高得分和平均得分分别为94.6%和94.4%,标志着其成为首个在此基准测试中获得第一名的中国代理系统。PinchBench评估的是代理完成复杂、真实世界任务并产生可验证结果的能力,而非仅仅是知识回忆,这突显了系统架构和工程与模型能力同等重要。

  8. SIGNIFICANT · CL_152184 ·

    阿里巴巴的 Qwen3.8 模型声称达到顶级性能,但缺乏基准测试

    阿里巴巴集团发布了其新模型 Qwen3.8,声称它是目前最强大的模型之一,可与领先的尖端模型相媲美。该模型拥有 2.4 万亿参数,能够处理文本、图像、视频和文档,在多项任务上超越了其前身 Qwen3.7 Max。预览版已在阿里巴巴平台上以优惠价格提供,并承诺将很快发布开放权重版本。然而,阿里巴巴尚未提供基准分数来支持其性能声明,这引起了人工智能界一些人的怀疑,他们质疑其与 Anthropic Fable 5 等模型的排名。

  9. TOOL · CL_146482 ·

    Anomaly 推出每月 10 美元的 OpenCode Go,提供精选的 AI 编码模型

    Anomaly 推出了 OpenCode Go,一项每月 10 美元的订阅服务,提供对 13 个开源 AI 编码模型的精选库的访问。该服务旨在为开发人员提供一种可靠且经济实惠的方式来使用这些模型,而无需管理多个 API 密钥或提供商。OpenCode Go 与现有的 OpenCode AI 编码代理无缝集成,也可以通过与 OpenAI 兼容的端点与其他工具一起使用。该套餐包含慷慨的使用限制,并优先考虑经过编码工作流程测试的模型,选项范…

  10. SIGNIFICANT · CL_145448 ·

    阿里云Qoder在中国AI编码市场份额占47.6%,领先地位稳固 · 追踪4个来源

    根据IDC的一份报告,阿里云的Qoder在中国AI编码领域占据了主导地位,市场份额达到47.6%。这使得Qoder领先于竞争对手,其市场份额超过了排在其后的四家公司的总和。该平台已从简单的代码助手发展成为一个全面的智能代理工作台,强调任务定义、执行监督和结果验收。Qoder的成功归功于其强大的底层模型Qwen3.7-Max,以及其对企业级功能(如知识集成、安全协议和可定制插件)的战略关注,使其成为快速增长的AI编码市场的关键参与者。

  11. TOOL · CL_142716 ·

    LLM 路由器通过将任务匹配到最便宜的模型来降低成本

    一种管理大型语言模型 (LLM) 成本的新方法涉及实现一个成本感知型路由层,该层将任务定向到最经济的模型,同时不损害质量。该方法根据复杂性对任务进行评分,将简单的请求发送到更便宜的 Flash 级模型,而将要求更高的请求发送到 Max/Pro 级模型。例如,根据 RouteAI 的定价,对于相同的 token 量,Qwen3.5 Flash 比 Qwen3.7 Max 便宜 25 倍。这种解耦的路由逻辑可以集成到各种应用程序中,如文档…

  12. FRONTIER RELEASE · CL_139743 ·

    阿里巴巴、智谱AI和MiniMax发布新AI模型,支持100万上下文窗口 · 追踪4个来源

    多家AI实验室发布了具有100万token上下文窗口的新模型。阿里巴巴集团宣布了Qwen3.7 Max和Qwen3.7 Plus,智谱AI发布了GLM-5.2,MiniMax推出了M3。这些模型的定价各不相同,Qwen3.7 Max每百万token的输入成本为1.25美元,输出成本为3.75美元;GLM-5.2的输入成本为0.98美元,输出成本为3.08美元;MiniMax M3的输入成本为0.3美元,输出成本为1.2美元。

  13. TOOL · CL_107660 ·

    SpaceX 测试星舰返回舱;阿里巴巴推出 AI '峰值-谷值' 令牌

    SpaceX 于 6 月 23 日首次成功发射其星舰返回舱,利用猎鹰 9 号火箭测试其再入和返回能力。该返回舱设计用于无人再入,将在受控飞行后溅落在太平洋。与此同时,阿里巴巴的 QoderWork 推出了

  14. SIGNIFICANT · CL_73970 ·

    阿里巴巴的 Qwen3.7 Max 挑战谷歌争夺人工智能第三名

    据报道,阿里巴巴的 Qwen3.7 Max 模型在性能基准测试中正挑战谷歌的人工智能模型,争夺第三名的位置。该模型的强大能力在近期的讨论中得到了突出,重点关注其颠覆当前人工智能格局的潜力。更多详情可通过提供的信息链接获取。

  15. FRONTIER RELEASE · CL_64608 ·

    阿里巴巴发布 Qwen3.7-Plus 多模态智能体模型

    阿里巴巴的 Qwen 团队发布了 Qwen3.7-Plus,这是一款除了文本之外,还能理解图像和视频的多模态大语言模型。该新模型增强了视觉能力,并保留了深度推理、自编程、工具调用和自主迭代等智能体功能。Qwen3.7-Plus 可通过阿里云的“百炼”平台获取,标志着阿里巴巴在具身智能领域为实际应用迈出了重要一步。

  16. RESEARCH · CL_56897 ·

    阿里巴巴、腾讯将AI从聊天机器人转向机器人技术

    中国科技巨头阿里巴巴和腾讯正将其AI重点从聊天机器人转向用于机器人技术的具身智能。阿里巴巴的Qwen3.7-Max模型现已包含控制机器人的工具调用能力,并辅以一套用于物理世界交互的新AI模型。腾讯的OpenClaw AI代理框架正被集成到量产的人形机器人中,使其能够将人类语音转化为即时的机器人动作。这一转变标志着从数字AI应用转向物理自主系统,其驱动力是投资者对具身智能作为主要增长领域的兴趣。

  17. SIGNIFICANT · CL_56706 ·

    阿里巴巴推出 Qwen3.7-Max,拥有 1M 上下文和自主编码能力

    阿里巴巴发布了 Qwen3.7-Max,这是一款 Agent-First 的 LLM,拥有 100 万 token 的上下文窗口,能够执行自主编码任务。该模型在没有人工干预的情况下进行了 35 小时的编码演示,为不熟悉的硬件优化代码,并在定制芯片性能内核上实现了 10 倍的加速。虽然该演示的独立复现尚待验证,但 Qwen3.7-Max 在 Terminal-Bench 2.0 和 MCP-Atlas 等基准测试中表现强劲,超越了部分竞…

  18. TOOL · CL_56001 ·

    阿里巴巴的 Qwen3.7-Max 在企业 IT 基准测试中排名第三

    阿里巴巴的 Qwen3.7-Max 模型在 ITBench-AA 基准测试中取得了第三名的成绩。该基准测试专门评估人工智能模型在代理式方法下,在真实企业 IT 场景中的表现。Qwen 团队强调这一成就标志着在人工智能代理时代迈出了重要一步。

  19. RESEARCH · CL_55869 ·

    阿里云发布金融大模型“点金”

    阿里云发布了专为金融行业打造的通用型智能代理“点金”。该代理旨在成为数字员工,能够执行回测、模型训练、风控和合规审查等任务,超越了简单的辅助功能。点金构建于阿里云完整的“芯片-云-模型-智能”技术栈之上,包括新的玄武M890 AI芯片和Qwen3.7-Max大语言模型,以确保在金融环境中的强大性能和合规性。阿里云还通过发布《金融行业大模型百模图》和金融AI数字员工技能的开源计划,推动行业标准化。

  20. TOOL · CL_55113 ·

    前沿AI模型未能通过新的IT基准测试,得分低于50%

    一项新的基准测试ITBench-AA已发布,用于评估前沿AI模型在企业IT任务(特别是站点可靠性工程SRE)方面的能力。在初步测试中,即使是Claude Opus 4.7和GPT-5.5等最先进的模型,在诊断Kubernetes事件方面的得分也低于50%。该基准测试显示,模型在根本原因分析方面存在困难,并且更长的调查轨迹不一定会带来更高的准确性,有些模型会过度调查并识别出假阳性。