PulseAugur
中
实时 00:04:46
English(EN) [Release] GSQ-RCO GGUFs for Qwen3.8-Flash-Next, plus a 50% expert-pruned Coder build at ~1.89 bpw

Qwen3.8-Flash-Next 模型发布,采用专家剪枝和先进量化技术

Qwen3.8-Flash-Next 模型的新版本现已发布,采用了 GSQ 和 RCO 等先进量化技术。这些模型在保持性能的同时显著减小了尺寸,其中一个版本在每参数 3.50 比特的情况下达到了基础模型 93.26% 的性能。一个专门的“Coder”版本通过移除模型一半的专家进一步优化,产生了 29.6 GB 的常驻工作集,可以在单个 32 GB 加速器上运行,同时仍保留其超过 90% 的编码基准能力。 AI

影响 提供了高度压缩的模型,可在消费级硬件上高效部署,从而扩大了对先进 AI 功能的访问范围。

排序理由 发布了带有量化方法技术细节的量化和剪枝的开源模型。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen3.8-Flash-Next 模型发布,采用专家剪枝和先进量化技术

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Loginhe ·

    [发布] GSQ-RCO GGUFs 支持 Qwen3.8-Flash-Next,另有专家剪枝 50% 的 Coder 版本,约 1.89 bpw

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1wt4s88/release_gsqrco_ggufs_for_qwen38flashnext_plus_a/"> <img alt="[Release] GSQ-RCO GGUFs for Qwen3.8-Flash-Next, plus a 50% expert-pruned Coder build at ~1.89 bpw" src="https://preview.redd.it/penwbxul8fsh…