PulseAugur
实时 04:47:59

EschaLabs 发布 2 位量化 Qwen3.6-35B-A3B 模型,支持本地 GPU 使用

EschaLabs 发布了 Escha-W2,这是 Qwen3.6-35B-A3B 混合专家模型的 2 位量化版本。该版本专为本地部署而设计,仅需一块 24 GB 的消费级 GPU,并提供兼容 OpenAI 的 HTTP API。用户可在两个运行时引擎之间选择:SGLang 支持并发和工具调用等功能;ZML 提供无 Python、单二进制文件的体验,在某些硬件上可能解码速度更快,但初始启动时间较长,且在较低显存的 GPU 上存在限制。 AI

影响 使得在消费级 GPU 上运行大型 MoE 模型成为可能,降低了本地 AI 部署的门槛。

排序理由 发布了具有特定硬件要求和运行时选项的量化模型,并非前沿模型发布。

在 Hugging Face Trending Models 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

EschaLabs 发布 2 位量化 Qwen3.6-35B-A3B 模型,支持本地 GPU 使用

报道来源 [1]

  1. Hugging Face Trending Models TIER_1 Deutsch(DE) · EschaLabs ·

    EschaLabs/Qwen3.6-35B-A3B-Escha-W2

    text-generation · 32 downloads · 63 likes