PulseAugur
实时 04:55:11
English(EN) ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs

新的LLM量化方法提升速度和准确性

两篇新的研究论文介绍了改进大型语言模型(LLM)效率的新型量化技术。FPTQuant专注于INT4量化的保持函数变换,实现了高达3.9倍的速度提升,且开销极小,准确性与较慢的方法相当。ARCQuant通过增强残差通道提升NVFP4量化,在保持最先进准确性的同时,使GPU上的速度比FP16提升高达3倍。 AI

影响 这些技术可以显著降低LLM推理的计算成本和能耗,使其更易于访问和可持续。

排序理由 两篇arXiv论文介绍了LLM的新型量化技术。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

新的LLM量化方法提升速度和准确性

报道来源 [3]

  1. arXiv cs.LG TIER_1 English(EN) · Donghyun Lee, Yuhang Li, Ruokai Yin, Priyadarshini Panda ·

    KronQ:通过 Kronecker 因子化 Hessian 实现 LLM 量化

    arXiv:2607.07964v1 Announce Type: new Abstract: Post-training quantization (PTQ) is a widely adopted technique for compressing large language models (LLMs) without retraining. Existing second-order PTQ methods, including GPTQ, construct quantization objectives exclusively from in…

  2. arXiv cs.LG TIER_1 English(EN) · Boris van Breugel, Yelysei Bondarenko, Paul Whatmough, Markus Nagel ·

    FPTQuant:用于大模型量化的函数保持变换

    arXiv:2506.04985v2 Announce Type: replace Abstract: Large language models (LLMs) require substantial compute, and thus energy, at inference time. While quantizing weights and activations is effective at improving efficiency, naive quantization of LLMs can significantly degrade pe…

  3. arXiv cs.AI TIER_1 English(EN) · Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Peng Zhang, Xindian Ma ·

    ARCQUANT:通过增强残差通道提升LLM的NVFP4量化性能

    arXiv:2601.07475v2 Announce Type: replace-cross Abstract: The emergence of fine-grained numerical formats like NVFP4 presents new opportunities for efficient Large Language Model (LLM) inference. However, it is difficult to adapt existing Post-Training Quantization (PTQ) strategi…