GSQ-RCO 发布了 Qwen3.8-Flash-Next 模型的新 GGUF 量化版本,显著将文件大小从 80-95GB 减小到 68-76GB,同时保持接近基线的质量。Q2_0 变体提供了显著的速度提升,与 IQ2_XS 相比,在编码任务上的提示吞吐量提高了 6.2 倍,总体提示吞吐量提高了 3.4 倍。此优化侧重于通过避免产生显著实时成本的量化格式来加快解码速度。 AI
影响 为本地 LLM 部署提供更小的模型占地面积和更快的推理速度。
排序理由 发布了具有性能指标的量化模型版本。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →