EschaLabs 发布了 Qwen3.8-27B 模型的 2 位量化版本,命名为 Escha-W2。新版本将模型大小显著减小至 10.15 GB,使其能够装入单块 24 GB 消费级 GPU,并支持 64k 上下文窗口。性能基准测试表明,Escha-W2 在常识推理方面具有与其 FP8 版本相当的竞争力,甚至超越了后者,在 LiveCodeBench 上与之持平,但在 GPQA-Diamond 上的性能略有下降。 AI
影响 使大型语言模型能够在消费级硬件上运行,可能促进其普及和使用。
排序理由 发布了带有性能基准测试的量化模型。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Trending Models 阅读 →
- EschaLabs/escha-runtime-qwen3dense
- EschaLabs/Qwen3.8-27B-Escha-W2
- Escha-W2
- huggingface_hub
- PyTorch
- Qwen3.8-27B
- Qwen3.8-27B-Escha-W2
- SGLang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →