EschaLabs 发布了 Escha-W2,这是 Qwen3.6-35B-A3B 混合专家模型的 2 位量化版本。该版本专为本地部署而设计,仅需一块 24 GB 的消费级 GPU,并提供兼容 OpenAI 的 HTTP API。用户可在两个运行时引擎之间选择:SGLang 支持并发和工具调用等功能;ZML 提供无 Python、单二进制文件的体验,在某些硬件上可能解码速度更快,但初始启动时间较长,且在较低显存的 GPU 上存在限制。 AI
影响 使得在消费级 GPU 上运行大型 MoE 模型成为可能,降低了本地 AI 部署的门槛。
排序理由 发布了具有特定硬件要求和运行时选项的量化模型,并非前沿模型发布。
在 Hugging Face Trending Models 阅读 →
- EschaLabs
- EschaLabs/Qwen3.6-35B-A3B-Escha-W2
- Escha-W2
- OpenAI
- Qwen3.6-35B-A3B
- RTX 3090
- RTX 4090
- RTX 5060 Ti
- RTX 5080
- RTX 5090
- SGLang
- ZML
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →