Activation Aware Quantization
PulseAugur coverage of Activation Aware Quantization — every cluster mentioning Activation Aware Quantization across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
FlipGate 工具衡量量化 LLM 中每个答案的翻转情况
一款名为 FlipGate 的新工具已被开发出来,用于评估量化大语言模型(LLM)的每个答案的一致性,超越了传统的准确性指标。FlipGate 衡量量化模型与基线相比,将正确答案错误化的频率,从而为可接受的变异建立一个“噪声基底”。这种方法旨在识别可能被整体准确性分数掩盖的回归问题,确保生产系统的可靠性更高。
-
量化对大型语言模型的影响:解释质量与压缩
dev.to 上最近的一篇讨论探讨了量化对大型语言模型的影响,特别是在 OpenCode Go 订阅服务的背景下。量化压缩模型权重以降低内存和计算需求,但其有效性因使用的方法和比特深度而异。虽然 Q8_0 和 Q5_K_M 等较高比特深度几乎保留了原始模型的所有质量,但 Q4_K_M,尤其是 Q2_K 等较低比特深度可能导致性能明显下降,这可能解释了用户对使用经过大量量化模型的服务的抱怨。
-
Tetra LLM 量化实现每参数 2.7 比特,提升推理速度
研究人员开发了 Tetra,一种将大语言模型(LLM)量化至平均每参数 2.7 比特的新颖方法,显著降低了内存需求。该技术基于 leech-lattice 量化,通过优化码本结构并采用专门的内核来最小化 GPU 内存加载的数据,从而实现这一目标。使用 Tetra 量化的模型,如 Qwen3 变体,在 MMLU 和 GSM8K 等基准测试中表现出与更高比特量化方法相当的性能,仅有轻微下降,同时在推理速度方面显示出显著提升。
-
新的 GRPO 方法在无需人类标签的情况下训练 NLI 模型
研究人员开发了一种使用群体相对策略优化 (GRPO)(一种强化学习方法)来训练自然语言推断 (NLI) 模型的新方法。该技术消除了对人类标注理由的需求,允许在 ANLI 等具有挑战性的数据集上训练模型。当使用 LoRA 和 QLoRA 等参数高效方法应用于 7B、14B 和 32B 语言模型时,GRPO 训练的模型在标准和对抗性 NLI 基准测试中表现出强大的性能。值得注意的是,32B 模型在对抗性数据集上的泛化能力优于监督基线,并且…
-
量化影响大语言模型输出的多样性和风格,而非偏见
一项新的研究论文探讨了权重量化对大语言模型行为的影响,特别是关注它是否会放大偏见或确定性。该研究在不同权重精度下服务了 Qwen3 模型的三个检查点,发现在 8B 规模下,int4 量化降低了输出的多样性和词汇丰富度。然而,在更大规模(14B 和 32B)下,未观察到显著的内容集中,但出现了风格漂移,例如破折号使用率的增加。研究还发现没有证据表明刻板印象被放大,输出集中于模态答案而非刻板印象答案。
-
新方法提升2位LLM权重解码效率
研究人员开发了一种新颖的2位LLM权重多壳解码方法,旨在提高效率和质量。所提出的方法包括离线扩展到GPU布局以及一个融合的解量化加矩阵向量乘内核,以最小化warp发散。该方法与各种位精确布局进行了测试,在恒定带宽下展示了在大小和速度方面的性能提升,并与FP16等更高精度格式相比显示出有竞争力的结果。
-
新研究探索用于效率的先进大模型量化技术
几篇新研究论文探索了用于量化大语言模型(LLM)以提高部署效率的先进技术。REAL-Q 引入了一种动态梯度下降方法,以最小化端到端 KL 散度,在 LLaMA-3.1 和 Qwen3 上显示出显著的改进。HBQ 提出了一种具有有效数字缩放的分层方法,以最大化硬件效率和准确性,优于现有方法。Q-Strata 专注于混合精度量化,用于专家混合模型,优化专家之间的比特分配。另一篇论文研究了量化损伤的结构,表明全局比特分配通常优于局部修复,而…
-
研究发现:量化大语言模型展现出层依赖性个性
一项新的研究论文探讨了量化大语言模型(LLMs)的个性特征,超越了以往仅关注全精度模型的研究所。该研究引入了不确定性放大层解码(UALD)方法,以分析个性的出现如何跨越不同层级,以及量化如何影响这些特征。主要发现表明,虽然ENFJ个性类型在各种模型和精度中普遍存在,但极端的2位量化会破坏提示一致性和跨精度一致性,个性决策主要出现在模型的上层。
-
LLM量化:不止是比特缩减
大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。
-
GGUF 量化版本在 Qwen3.6 27B 模型上优于 NVFP4、AWQ 和 FP8
对 Qwen3.6 27B 模型各种量化方法的比较显示,GGUF 格式通常提供最佳的质量与大小权衡。这些不量化激活的 GGUF 模型与 NVFP4、AWQ、AutoRound 和 FP8 等其他格式相比,显示出较低的 KL 散度。研究发现,vLLM 量化的有效性可能差异很大,有些表现明显不如其他相似甚至更小的量化版本。
-
LLM用户寻求关于比较来自不同来源的量化模型的指导
r/LocalLLaMA subreddit上的用户正在寻求关于如何有效比较和管理来自各种来源的量化大型语言模型(LLM)的指导。主要挑战在于变量过多,包括不同的发布者、GGUF和GPTQ等量化格式,以及温度和top-k等模型参数。参与者正在寻找简化评估过程的策略,由于下载和配置要求,这个过程非常耗时,以确定性能最佳的模型。
-
AWQ在本地LLM的4位量化方面优于GPTQ,但GPU和内核是关键
对本地大型语言模型(LLM)的4位量化方法进行的比较表明,激活感知量化(AWQ)通常优于GPTQ。然而,研究强调,实际性能在很大程度上受到底层内核和图形处理单元(GPU)的影响,而不仅仅是量化格式。
-
研究发现:量化对代码生成模型影响不同
一项新研究调查了各种量化方法对大型代码生成模型在资源受限硬件上运行时性能的影响。研究人员使用 Python 和 Java 基准测试,在 Qwen2.5-Coder 和 CodeLlama 模型上评估了包括 GPTQ、AWQ 和 AQLM 在内的六种最先进技术。研究结果表明,量化方法对代码的正确性和质量有显著且不同的影响,其中 AQLM 的表现与全精度模型相当,而 QuIP# 的性能下降最大。
-
量化技术将LLM缩小75%以供本地使用,平衡大小与质量
量化是将大型语言模型(LLM)缩小并降低其内存需求的关键技术,使其能在消费级硬件上使用。该过程涉及使用更少的比特(例如4位或8位)来表示模型参数,可以将模型大小缩小高达75%。然而,朴素的量化可能会因异常权重和累积误差而降低模型质量,这促使了GPTQ和AWQ等更复杂方法的出现,这些方法使用小型数据集校准量化以最小化误差。GGUF等格式(与llama.cpp一起使用)为CPU和混合推理提供了各种量化级别。
-
自托管 LLM 将成本转移到持续评估上
自托管开源大型语言模型将主要成本从 API 使用转移到持续的模型评估工作。量化是减少模型本地使用大小的常用技术,但可能会在推理和长上下文检索等关键任务上微妙地降低性能。此外,推理引擎(如 vLLM 或 TGI)的选择也会以不易察觉的方式改变模型行为。与维护持续评估流程的托管模型提供商不同,大多数自托管团队只测试模型一次,这可能导致性能随着时间的推移而下降而未被发现。
-
优化 SLM 服务:AWQ、GPTQ、GGUF 和动态 LoRA
本文探讨了为企业环境优化小型语言模型(SLM)的服务,重点关注降低延迟、提高并发性和最小化成本。文章比较了三种量化格式:AWQ、GPTQ 和 GGUF,并推荐 AWQ,因为它在 GPU 上实现了准确性和速度的平衡。文章还详细介绍了如何使用 vLLM 实现动态 LoRA 服务,以有效地管理共享基础设施上多个微调模型的行为,从而减少 VRAM 使用量和计算成本。
-
OpenPangu LLM 量化在 Ascend NPU 上的研究:8 位无损,4 位导致 1B 模型性能下降
一项新研究调查了在 Ascend NPU 上部署 OpenPangu 大型语言模型时,各种训练后量化方法的有效性。研究人员发现,8 位仅权重量化对于 1B 和 7B 参数模型几乎是无损的。然而,4 位量化在 1B 模型上表现出更显著的性能下降,尤其是在推理和编码任务中,而对于 7B 模型则仍然可行。研究还强调了超低精度量化的挑战,大多数 2 位和二值化设置导致性能接近随机。
-
GLM-5.2 speculative decode runs on 4x DGX GB10 cluster
一位用户成功在 4x DGX GB10 集群上实现了 GLM-5.2 和 MTP 投机解码,实现了约 9.4 tokens/秒的吞吐量。这涉及到从公共内核重建缺失的构建修改,并确保使用特定的 vLLM 参考提交以避免权重加载错误。用户还详细介绍了优化设置的步骤,包括一种无数据剪枝方法以将模型装入内存,以及关于多节点性能网络配置的说明。
-
用户寻求优化 MI50 GPU 上 Qwen 3.5 9B 推理的帮助
一位用户正在寻求帮助,以便在 MI50 32GB GPU 上为 Qwen 3.5 9B 模型配置以实现最佳本地推理。在使用特定的 vLLM 分支时,他们遇到的速度很慢,低于每秒 1 个 token。用户正在寻求指导以提高性能,并可能设置一个视觉/文本到文本模型或 Gemma 4 变体。
-
大语言模型量化格式:GGUF、GPTQ、AWQ 和 NF4 对比
本文比较了四种主要的大语言模型(LLM)权重量化格式:GGUF、GPTQ、AWQ 和 NF4。量化对于减小模型尺寸以适应有限的硬件限制(如消费级 GPU 或统一内存系统)至关重要。每种格式在内存占用、推理速度和准确性之间提供了不同的权衡,使其适用于特定的部署场景。