GPTAQ
PulseAugur coverage of GPTAQ — every cluster mentioning GPTAQ across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法改进LLM量化,以减小尺寸和成本 · 跟踪2个来源
两篇新的研究论文提出了用于大型语言模型(LLM)训练后量化(PTQ)的新颖方法,旨在减小它们的尺寸和计算需求。第一篇论文《From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization》介绍了交错跨块量化(ICBQ),该方法通过两次重新访问来精炼量化边界。第二篇论文《ReQuant: Fixed-Grid Discrete Refinement for Po…
-
KronQ 框架利用梯度协方差增强 LLM 量化
研究人员推出 KronQ,一个新颖的训练后量化 (PTQ) 框架,旨在更有效地压缩大型语言模型 (LLM)。与仅依赖激活统计数据的先前方法不同,KronQ 将梯度协方差纳入其量化目标。这种方法利用 Kronecker 因子 Hessian 近似,提高了权重幅度方差,并为混合精度分配提供了新指标。在对 LLaMA-3-70B 进行的实验中,KronQ 在 2 位仅权重量化中实现了 7.93 的困惑度,显著优于 GPTQ 和 GPTAQ …
-
OpenPangu LLM 量化在 Ascend NPU 上的研究:8 位无损,4 位导致 1B 模型性能下降
一项新研究调查了在 Ascend NPU 上部署 OpenPangu 大型语言模型时,各种训练后量化方法的有效性。研究人员发现,8 位仅权重量化对于 1B 和 7B 参数模型几乎是无损的。然而,4 位量化在 1B 模型上表现出更显著的性能下降,尤其是在推理和编码任务中,而对于 7B 模型则仍然可行。研究还强调了超低精度量化的挑战,大多数 2 位和二值化设置导致性能接近随机。