SmoothQuant
PulseAugur coverage of SmoothQuant — every cluster mentioning SmoothQuant across labs, papers, and developer communities, ranked by signal.
-
新的ADMM-Q算法增强了LLM量化,降低了困惑度
研究人员开发了ADMM-Q,这是一种旨在改进大型语言模型训练后量化的新算法。该方法利用交替方向乘子法的组合变体来解决逐层量化问题,旨在降低存储和计算需求,同时不显著影响模型效用。ADMM-Q被设计为现有量化器的模块化替代品,并且可以与其他技术集成。在Qwen3-8B模型上的初步测试显示,在各种量化设置下困惑度均有显著降低。
-
新研究探索用于效率的先进大模型量化技术
几篇新研究论文探索了用于量化大语言模型(LLM)以提高部署效率的先进技术。REAL-Q 引入了一种动态梯度下降方法,以最小化端到端 KL 散度,在 LLaMA-3.1 和 Qwen3 上显示出显著的改进。HBQ 提出了一种具有有效数字缩放的分层方法,以最大化硬件效率和准确性,优于现有方法。Q-Strata 专注于混合精度量化,用于专家混合模型,优化专家之间的比特分配。另一篇论文研究了量化损伤的结构,表明全局比特分配通常优于局部修复,而…
-
LLM量化:不止是比特缩减
大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。
-
新的预处理方法提高了量化矩阵乘法的精度
研究人员开发了一种名为收缩-度量预处理的新方法,以提高量化矩阵乘法的精度,这是深度学习中的一项关键操作。该技术在量化之前联合选择因子表示及其共享模式,旨在减少乘积误差。该方法在图像分类任务上进行了评估,与现有基线相比,在 8 位和 4 位精度下均显示出显著的精度提高。
-
新的 W4A4 量化技术增强了 Wan2.2-I2V-A14B 模型的推理能力
研究人员为 Wan2.2-I2V-A14B 模型开发了一种新颖的 W4A4 量化技术,旨在提高低比特宽度硬件上的推理效率。他们的方法将激活值异常的混合精度与逐通道平滑和前馈层的块状打包相结合。该方法在 VBench I2V 指标上取得了接近 FP16 的 2-3.5% 的结果,优于原生的 HiFloat4 基线。
-
OpenPangu LLM 量化在 Ascend NPU 上的研究:8 位无损,4 位导致 1B 模型性能下降
一项新研究调查了在 Ascend NPU 上部署 OpenPangu 大型语言模型时,各种训练后量化方法的有效性。研究人员发现,8 位仅权重量化对于 1B 和 7B 参数模型几乎是无损的。然而,4 位量化在 1B 模型上表现出更显著的性能下降,尤其是在推理和编码任务中,而对于 7B 模型则仍然可行。研究还强调了超低精度量化的挑战,大多数 2 位和二值化设置导致性能接近随机。
-
llmcompressor 工具通过 FP8、GPTQ、SmoothQuant 实现 LLM 压缩
一款名为 llmcompressor 的新开源工具允许开发人员压缩和基准测试指令微调的大型语言模型。该工具演示了如何应用 FP8、GPTQ 和 SmoothQuant 等训练后量化技术。此过程旨在减小模型尺寸并提高推理速度,同时评估性能权衡。
-
优化Transformer推理:更快、更便宜的大模型技术
大型Transformer模型因其巨大的内存占用和计算成本,给推理带来了显著挑战,这些成本随输入长度呈二次方增长。研究人员和从业者正在探索各种优化技术来缓解这些问题。这些方法包括网络压缩策略,如剪枝、量化和知识蒸馏,以及架构改进和高效并行。目标是减少内存使用、计算复杂度和推理延迟,以实现实际的大规模部署。