PulseAugur
实时 08:28:03
English(EN) Qwen3.8-Max says it beats GPT-5.6 and Fable 5 at computer use. Here's my checklist before I believe any open-weights release

阿里巴巴的 Qwen3.8-Max 声称在 GPT-5.6、Fable 5 上达到 SOTA,但面临审查

阿里巴巴发布了 Qwen3.8-Max,这是一个拥有 2.4 万亿参数和 100 万 token 上下文窗口的模型,声称在代理计算机使用基准测试中超越了 GPT-5.6Claude Fable 5。然而,作者敦促谨慎,强调需要核实模型的许可证,区分自我报告和独立基准测试,并考虑运行如此大型模型的实际可行性。作者对一个较小的 27B 版本特别感兴趣,该版本更容易自行托管,并且如果以宽松的许可证发布,可能会产生更大的影响。 AI

影响 如果 Qwen3.8-27B 模型以宽松的许可证发布并且性能如声称的那样,它可能会极大地促进独立开发者和自行托管能力。

排序理由 前沿实验室模型发布,附带系统卡和基准测试声明。[lever_c_降级自 frontier_release: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

阿里巴巴的 Qwen3.8-Max 声称在 GPT-5.6、Fable 5 上达到 SOTA,但面临审查

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · frank chu ·

    Qwen3.8-Max 声称其在计算机使用方面超越 GPT-5.6 和 Fable 5。在我相信任何开源模型发布之前,这是我的核查清单

    <p>Alibaba released Qwen3.8-Max on August 3: a 2.4-trillion-parameter MoE with a 1M-token context window, priced at $2/$6 per million tokens. The claim that got everyone's attention: <strong>86.1 on OSWorld-Verified</strong>, ahead of GPT-5.6 Sol Max (83.2) and Claude Fable 5 (85…