GPTQ
PulseAugur coverage of GPTQ — every cluster mentioning GPTQ across labs, papers, and developer communities, ranked by signal.
- competes with Activation Aware Quantization 75%
- instance of Activation Aware Quantization 70%
- instance of GGUF 70%
- used by waqf 70%
- used by Int4 70%
- used by vLLM 70%
- instance of Gotit.pub 70%
- instance of bfloat16 70%
- used by bitsandbytes 70%
- uses vLLM 70%
- used by Activation Aware Quantization 60%
- used by GGUF 60%
7 天有情绪数据
-
新的OSFP4量化方案提高了LLM推理精度
研究人员开发了一种名为OSFP4的新量化方案,旨在提高NVFP4数据类型在大型语言模型(LLM)推理中的精度。OSFP4优化了对角平滑矩阵和块缩放,以最小化量化误差,在各种设置下精度均优于现有方法。该新方案保持了大部分供应商NVFP4预填充吞吐量,使其成为高效LLM部署的有吸引力的选择。
-
FlipGate 工具衡量量化 LLM 中每个答案的翻转情况
一款名为 FlipGate 的新工具已被开发出来,用于评估量化大语言模型(LLM)的每个答案的一致性,超越了传统的准确性指标。FlipGate 衡量量化模型与基线相比,将正确答案错误化的频率,从而为可接受的变异建立一个“噪声基底”。这种方法旨在识别可能被整体准确性分数掩盖的回归问题,确保生产系统的可靠性更高。
-
量化对大型语言模型的影响:解释质量与压缩
dev.to 上最近的一篇讨论探讨了量化对大型语言模型的影响,特别是在 OpenCode Go 订阅服务的背景下。量化压缩模型权重以降低内存和计算需求,但其有效性因使用的方法和比特深度而异。虽然 Q8_0 和 Q5_K_M 等较高比特深度几乎保留了原始模型的所有质量,但 Q4_K_M,尤其是 Q2_K 等较低比特深度可能导致性能明显下降,这可能解释了用户对使用经过大量量化模型的服务的抱怨。
-
新研究详细介绍了循环 Transformer 中的量化失败
研究人员在循环 Transformer 的训练后量化 (PTQ) 中识别出两种关键的失败模式,这些 Transformer 在递归步骤中重用权重。第一种称为“反馈暴露”,当量化层在没有恒等路径的情况下扰乱递归状态时发生,导致错误放大。第二种“校准盲目性”源于量化方法,这些方法基于初始激活值进行计算,而忽略了递归中的后续状态。在 Huginn-3.5B 和 Mamba 等模型上的实验证明了这些问题,而跨递归步骤累积 Hessian 的解…
-
新的量化方法优化 Transformer 注意力输出
研究人员开发了一种新的量化 Transformer 模型的方法,重点关注注意力机制的 Q、K 和 V 投影。这种方法称为 JAB,直接优化注意力输出而不是单个权重矩阵,在 Mistral-7B 的 3 位量化上表现出改进的性能。然而,当包含 MLP 层时,该方法的有效性会降低,在这种情况下,一种面向角色的偏移规则被证明更成功,在 Mistral-7B 上实现了接近全精度困惑度但压缩率很高。
-
新的WaterKron方法利用克罗内克因子化的Hessian改进AI模型量化
研究人员开发了WaterKron,一种利用克罗内克因子化Hessian近似进行训练后量化的新方法。该方法结合了双面GPTQ、水填充尺度和熵编码,引入了一个因子$\Phi$来量化克罗内克近似的失真惩罚。最小化该因子会导致FlipFlop Hessian,这得到了率失真理论的证明,并且在经验上显示与其他的Hessian近似方法相比,可以改善KL散度和困惑度。
-
Qwen3-8B模型已扩展用于超低比特语言处理
研究人员已成功将训练后三元化技术扩展到Qwen3-8B语言模型,旨在降低存储和内存需求。该研究进行了全面的评估,包括复现门、能力分析和直接打包执行。在三个语料库上,该8B模型达到了1.361倍的困惑度比,并在零样本任务上保持了64.6%的准确率,证明了其对激进离散化的鲁棒性。
-
Mistral Small 3.2 发布,增强了函数调用和 128K 上下文
Mistral AI 发布了 Mistral Small 3.2,这是一个开放权重模型,具有改进的函数调用和 128K 上下文窗口。此次更新增强了模型处理工具区分的能力,并为多轮对话提供更清晰的 JSON 输出。虽然在推理基准测试中与 GPT-4o mini 等模型具有竞争力,但 Mistral Small 3.2 在需要大上下文窗口和可靠工具编排的场景中表现尤为出色,提供了经济高效的自托管选项。
-
新的ADMM-Q算法增强了LLM量化,降低了困惑度
研究人员开发了ADMM-Q,这是一种旨在改进大型语言模型训练后量化的新算法。该方法利用交替方向乘子法的组合变体来解决逐层量化问题,旨在降低存储和计算需求,同时不显著影响模型效用。ADMM-Q被设计为现有量化器的模块化替代品,并且可以与其他技术集成。在Qwen3-8B模型上的初步测试显示,在各种量化设置下困惑度均有显著降低。
-
新研究探索用于效率的先进大模型量化技术
几篇新研究论文探索了用于量化大语言模型(LLM)以提高部署效率的先进技术。REAL-Q 引入了一种动态梯度下降方法,以最小化端到端 KL 散度,在 LLaMA-3.1 和 Qwen3 上显示出显著的改进。HBQ 提出了一种具有有效数字缩放的分层方法,以最大化硬件效率和准确性,优于现有方法。Q-Strata 专注于混合精度量化,用于专家混合模型,优化专家之间的比特分配。另一篇论文研究了量化损伤的结构,表明全局比特分配通常优于局部修复,而…
-
研究发现:量化大语言模型展现出层依赖性个性
一项新的研究论文探讨了量化大语言模型(LLMs)的个性特征,超越了以往仅关注全精度模型的研究所。该研究引入了不确定性放大层解码(UALD)方法,以分析个性的出现如何跨越不同层级,以及量化如何影响这些特征。主要发现表明,虽然ENFJ个性类型在各种模型和精度中普遍存在,但极端的2位量化会破坏提示一致性和跨精度一致性,个性决策主要出现在模型的上层。
-
指南解释本地部署大语言模型所需的VRAM
在本地运行大语言模型需要仔细管理VRAM,因为模型大小和量化会显著影响内存使用。虽然没有精确的公式,但可以通过考虑模型的参数数量、权重的比特宽度(例如FP16、INT8、INT4)以及激活和临时缓冲区的开销来估算VRAM需求。Ollama、GPTQ和bitsandbytes等工具可以促进量化,从而减小内存占用。例如,一个量化到INT8的130亿参数模型可能需要大约18 GB的VRAM,这个数字可以使用nvidia-smi等工具进行检查。
-
LLM量化:不止是比特缩减
大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。
-
SchurQuant 提升 LLM 量化精度,2 位模型精度提升超 11 pp
研究人员开发了 SchurQuant,一种用于大型语言模型 (LLM) 的逐层量化新方法,可显著提高精度,尤其是在较低比特率下。该技术包含一个名为 SCHUROPT 的组件,通过消除剩余后缀的最佳连续响应并优化离散码来分析优化量化过程。SchurQuant 在 2 位 Qwen3-4B 模型上表现出显著的收益,优于现有的无反向传播方法高达 11.88 个百分点,并在各种 Llama 和 Qwen 模型上实现了最高的零样本精度。
-
新方法改进LLM量化,以减小尺寸和成本 · 跟踪2个来源
两篇新的研究论文提出了用于大型语言模型(LLM)训练后量化(PTQ)的新颖方法,旨在减小它们的尺寸和计算需求。第一篇论文《From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization》介绍了交错跨块量化(ICBQ),该方法通过两次重新访问来精炼量化边界。第二篇论文《ReQuant: Fixed-Grid Discrete Refinement for Po…
-
新的 KLQ 量化方法优化 LLM 位宽分配
一项名为 KLQ 的新研究项目,引入了一种用于量化大型语言模型的无训练方法。该方法测量嵌入空间的不均匀性,并根据 KL 散度测量的不同方向的重要性来最优地分配位宽。与依赖方差或可学习旋转的先前方法不同,KLQ 直接评估破坏特定方向的经验成本。虽然有效,但该方法计算量很大,需要多次前向传播才能量化模型。
-
LLM用户寻求关于比较来自不同来源的量化模型的指导
r/LocalLLaMA subreddit上的用户正在寻求关于如何有效比较和管理来自各种来源的量化大型语言模型(LLM)的指导。主要挑战在于变量过多,包括不同的发布者、GGUF和GPTQ等量化格式,以及温度和top-k等模型参数。参与者正在寻找简化评估过程的策略,由于下载和配置要求,这个过程非常耗时,以确定性能最佳的模型。
-
新的GRIT格式旨在防止量化AI模型中的静默错误
一种名为GRIT(Grouped Reduced-precision Interchange Type)的新型交换格式已被开发出来,以解决量化模型检查点中的关键错误。这些错误在vLLM和SGLang等系统中静默发生,由于数值格式、比例约定和数据布局处理方式的差异,导致模型输出不正确。GRIT引入了一个结构化的四元组——Grade、Placement、Planes和Shape——明确定义了数值约定和物理布局,确保这些细节在每个边界都清晰…
-
新方法提高神经网络量化效率和准确性
研究人员开发了新的神经网络量化方法,该过程可减少 AI 模型对内存和计算的要求。第一篇论文介绍了 BaKron,一种使用 Kronecker 分解的 Hessian 近似来提高量化准确性同时保持与 GPTQ 等现有方法相当的计算效率的高效求解器。第二篇论文提出了归一化仿射预处理 (NAP),它针对参数的特定子空间(归一化仿射参数)来显著增强量化鲁棒性,特别是对于紧凑型网络,其性能优于传统的全参数训练方法。
-
新研究探索大语言模型效率和推理能力的提升
多篇研究论文探讨了提高大语言模型(LLMs)效率和可靠性的方法。Hugging Face 的 LFM2.5-DSpark 通过使用推测性解码技术,展示了高达 3.2 倍的推理速度提升。OpWeave 和 LayerRoute 分别提出了用于跨异构硬件优化大语言模型服务和实现自适应层跳过的框架。其他研究则关注大语言模型的推理和校准,其中 ZebraArena 为工具增强型大语言模型提供了诊断环境,而 Efficiency Halluci…