Qwen3.8-Flash-Next 模型的新版本现已发布,采用了 GSQ 和 RCO 等先进量化技术。这些模型在保持性能的同时显著减小了尺寸,其中一个版本在每参数 3.50 比特的情况下达到了基础模型 93.26% 的性能。一个专门的“Coder”版本通过移除模型一半的专家进一步优化,产生了 29.6 GB 的常驻工作集,可以在单个 32 GB 加速器上运行,同时仍保留其超过 90% 的编码基准能力。 AI
影响 提供了高度压缩的模型,可在消费级硬件上高效部署,从而扩大了对先进 AI 功能的访问范围。
排序理由 发布了带有量化方法技术细节的量化和剪枝的开源模型。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →