PulseAugur
实时 10:02:20
English(EN) Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs

新的循环残差量化方法加速 LLM 部署

研究人员开发了循环残差量化 (RRQ),一种用于大型语言模型 (LLM) 的新型训练后量化框架。RRQ 通过将权重表示为具有连续量化残差校正的低比特量化基数,从而允许从单个检查点获得多种有效精度。该方法无需校准,并且比现有技术快得多,在 25 分钟内为 Qwen3-8B 构建了完整的 2-/4-/6-/8 位包,比 MatGPTQ 快 3.3 倍。在六个 LLM 上进行的实验表明,在 6 位和 8 位下具有可竞争的准确性,在 4 位下性能可变。 AI

影响 这种新的量化方法可以实现更高效的大型语言模型在更广泛的硬件上的部署。

排序理由 该集群包含一篇详细介绍 LLM 量化新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的循环残差量化方法加速 LLM 部署

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yu Luo, Bo Dong, Wenhua Cheng, Haihao Shen ·

    循环残差量化:LLM 的渐进式多精度表示

    arXiv:2608.04048v1 Announce Type: cross Abstract: Serving large language models (LLMs) under diverse deployment constraints requires flexible trade-offs between accuracy, memory footprint, and throughput. However, conventional quantization methods typically require a separate che…