PulseAugur
实时 09:36:35
实体 GPTQ

GPTQ

PulseAugur coverage of GPTQ — every cluster mentioning GPTQ across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 34
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 19
层级分布 · 90 天
主题
关系
情绪 · 30 天

10 天有情绪数据

最近 · 第 1/2 页 · 共 34 条
  1. TOOL · CL_211588 ·

    LLM量化:不止是比特缩减

    大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。

  2. TOOL · CL_206386 ·

    SchurQuant 提升 LLM 量化精度,2 位模型精度提升超 11 pp

    研究人员开发了 SchurQuant,一种用于大型语言模型 (LLM) 的逐层量化新方法,可显著提高精度,尤其是在较低比特率下。该技术包含一个名为 SCHUROPT 的组件,通过消除剩余后缀的最佳连续响应并优化离散码来分析优化量化过程。SchurQuant 在 2 位 Qwen3-4B 模型上表现出显著的收益,优于现有的无反向传播方法高达 11.88 个百分点,并在各种 Llama 和 Qwen 模型上实现了最高的零样本精度。

  3. RESEARCH · CL_191134 ·

    新方法改进LLM量化,以减小尺寸和成本 · 跟踪2个来源

    两篇新的研究论文提出了用于大型语言模型(LLM)训练后量化(PTQ)的新颖方法,旨在减小它们的尺寸和计算需求。第一篇论文《From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization》介绍了交错跨块量化(ICBQ),该方法通过两次重新访问来精炼量化边界。第二篇论文《ReQuant: Fixed-Grid Discrete Refinement for Po…

  4. TOOL · CL_192305 ·

    新的 KLQ 量化方法优化 LLM 位宽分配

    一项名为 KLQ 的新研究项目,引入了一种用于量化大型语言模型的无训练方法。该方法测量嵌入空间的不均匀性,并根据 KL 散度测量的不同方向的重要性来最优地分配位宽。与依赖方差或可学习旋转的先前方法不同,KLQ 直接评估破坏特定方向的经验成本。虽然有效,但该方法计算量很大,需要多次前向传播才能量化模型。

  5. COMMENTARY · CL_188487 ·

    LLM用户寻求关于比较来自不同来源的量化模型的指导

    r/LocalLLaMA subreddit上的用户正在寻求关于如何有效比较和管理来自各种来源的量化大型语言模型(LLM)的指导。主要挑战在于变量过多,包括不同的发布者、GGUF和GPTQ等量化格式,以及温度和top-k等模型参数。参与者正在寻找简化评估过程的策略,由于下载和配置要求,这个过程非常耗时,以确定性能最佳的模型。

  6. TOOL · CL_185098 ·

    新的GRIT格式旨在防止量化AI模型中的静默错误

    一种名为GRIT(Grouped Reduced-precision Interchange Type)的新型交换格式已被开发出来,以解决量化模型检查点中的关键错误。这些错误在vLLM和SGLang等系统中静默发生,由于数值格式、比例约定和数据布局处理方式的差异,导致模型输出不正确。GRIT引入了一个结构化的四元组——Grade、Placement、Planes和Shape——明确定义了数值约定和物理布局,确保这些细节在每个边界都清晰…

  7. RESEARCH · CL_183454 ·

    新方法提高神经网络量化效率和准确性

    研究人员开发了新的神经网络量化方法,该过程可减少 AI 模型对内存和计算的要求。第一篇论文介绍了 BaKron,一种使用 Kronecker 分解的 Hessian 近似来提高量化准确性同时保持与 GPTQ 等现有方法相当的计算效率的高效求解器。第二篇论文提出了归一化仿射预处理 (NAP),它针对参数的特定子空间(归一化仿射参数)来显著增强量化鲁棒性,特别是对于紧凑型网络,其性能优于传统的全参数训练方法。

  8. COMMENTARY · CL_175393 ·

    到 2026 年,AI 开发转向本地优先以提高速度和隐私性

    AI 开发格局正迅速转向本地优先的方法,这是由克服云 API 延迟、确保数据隐私和降低成本的需求所驱动的。到 2026 年,在本地硬件上运行 AI 模型预计将成为开发者的默认选择,从而在速度和控制方面带来显著的改进。这一转变得益于模型量化、高效推理引擎以及功能媲美专有产品的开源模型的可用性日益提高。

  9. TOOL · CL_171958 ·

    新的GPTQ-2D算法将矩阵舍入时间缩短至立方

    研究人员推出了一种名为GPTQ-2D的新型算法,旨在提高矩阵自适应舍入方法的效率。与现有逐个处理矩阵条目的方法不同,GPTQ-2D采用逐条对角线进行舍入,从而可以并行处理独立的条目。这种方法将计算时间从四次方降低到立方,为涉及矩阵舍入的任务提供了显著的加速。

  10. TOOL · CL_181505 ·

    GPTQ-2D 通过立方时间并行处理推进矩阵舍入

    研究人员推出了一种新颖的自适应实数矩阵到整数舍入方法 GPTQ-2D。该技术是现有方法(如 GPTQ 和 Babai 的最近平面算法)的扩展,解决了舍入问题的双面版本。与之前逐个处理条目的方法不同,GPTQ-2D 按反对角线逐个进行舍入,从而实现并行处理并达到立方时间复杂度。

  11. TOOL · CL_157524 ·

    AWQ在本地LLM的4位量化方面优于GPTQ,但GPU和内核是关键

    对本地大型语言模型(LLM)的4位量化方法进行的比较表明,激活感知量化(AWQ)通常优于GPTQ。然而,研究强调,实际性能在很大程度上受到底层内核和图形处理单元(GPU)的影响,而不仅仅是量化格式。

  12. TOOL · CL_148005 ·

    研究发现:量化对代码生成模型影响不同

    一项新研究调查了各种量化方法对大型代码生成模型在资源受限硬件上运行时性能的影响。研究人员使用 Python 和 Java 基准测试,在 Qwen2.5-Coder 和 CodeLlama 模型上评估了包括 GPTQ、AWQ 和 AQLM 在内的六种最先进技术。研究结果表明,量化方法对代码的正确性和质量有显著且不同的影响,其中 AQLM 的表现与全精度模型相当,而 QuIP# 的性能下降最大。

  13. TOOL · CL_142327 ·

    MedGemma-1.5-4B 使用 llm-compressor 量化到 INT4

    一份技术指南详细介绍了使用 llm-compressor 库将 Google 的 MedGemma-1.5-4B 医学视觉语言模型量化到 INT4 (W4A16) 的过程。作者遇到了并解决了几个问题,包括 AutoAWQ 的弃用以及与 Gemma3 架构的兼容性问题。该指南提供了设置环境、加载模型、准备校准数据集和运行量化过程的具体步骤,最终将模型的自托管部署大小从 8.6 GB 减少到 5.2 GB。

  14. TOOL · CL_133678 ·

    量化技术将LLM缩小75%以供本地使用,平衡大小与质量

    量化是将大型语言模型(LLM)缩小并降低其内存需求的关键技术,使其能在消费级硬件上使用。该过程涉及使用更少的比特(例如4位或8位)来表示模型参数,可以将模型大小缩小高达75%。然而,朴素的量化可能会因异常权重和累积误差而降低模型质量,这促使了GPTQ和AWQ等更复杂方法的出现,这些方法使用小型数据集校准量化以最小化误差。GGUF等格式(与llama.cpp一起使用)为CPU和混合推理提供了各种量化级别。

  15. TOOL · CL_139669 ·

    KronQ 框架利用梯度协方差增强 LLM 量化

    研究人员推出 KronQ,一个新颖的训练后量化 (PTQ) 框架,旨在更有效地压缩大型语言模型 (LLM)。与仅依赖激活统计数据的先前方法不同,KronQ 将梯度协方差纳入其量化目标。这种方法利用 Kronecker 因子 Hessian 近似,提高了权重幅度方差,并为混合精度分配提供了新指标。在对 LLaMA-3-70B 进行的实验中,KronQ 在 2 位仅权重量化中实现了 7.93 的困惑度,显著优于 GPTQ 和 GPTAQ …

  16. COMMENTARY · CL_130187 ·

    自托管 LLM 将成本转移到持续评估上

    自托管开源大型语言模型将主要成本从 API 使用转移到持续的模型评估工作。量化是减少模型本地使用大小的常用技术,但可能会在推理和长上下文检索等关键任务上微妙地降低性能。此外,推理引擎(如 vLLM 或 TGI)的选择也会以不易察觉的方式改变模型行为。与维护持续评估流程的托管模型提供商不同,大多数自托管团队只测试模型一次,这可能导致性能随着时间的推移而下降而未被发现。

  17. TOOL · CL_122053 ·

    优化 SLM 服务:AWQ、GPTQ、GGUF 和动态 LoRA

    本文探讨了为企业环境优化小型语言模型(SLM)的服务,重点关注降低延迟、提高并发性和最小化成本。文章比较了三种量化格式:AWQ、GPTQ 和 GGUF,并推荐 AWQ,因为它在 GPU 上实现了准确性和速度的平衡。文章还详细介绍了如何使用 vLLM 实现动态 LoRA 服务,以有效地管理共享基础设施上多个微调模型的行为,从而减少 VRAM 使用量和计算成本。

  18. TOOL · CL_115676 ·

    OpenPangu LLM 量化在 Ascend NPU 上的研究:8 位无损,4 位导致 1B 模型性能下降

    一项新研究调查了在 Ascend NPU 上部署 OpenPangu 大型语言模型时,各种训练后量化方法的有效性。研究人员发现,8 位仅权重量化对于 1B 和 7B 参数模型几乎是无损的。然而,4 位量化在 1B 模型上表现出更显著的性能下降,尤其是在推理和编码任务中,而对于 7B 模型则仍然可行。研究还强调了超低精度量化的挑战,大多数 2 位和二值化设置导致性能接近随机。

  19. TOOL · CL_113441 ·

    开发者从头开始实现 GPTQ 量化,实现了最小的性能损失

    一位开发者详细介绍了他们从头开始在 nanoGPT 模型上实现 GPTQ 量化方法的过程。该技术通过降低权重的精度来减小模型大小并加快推理速度,但与朴素方法不同的是,GPTQ 会考虑权重之间的相互依赖性。开发者解释说,GPTQ 使用 Hessian 矩阵通过二阶近似损失景观来最小化准确性下降,在 61 个量化层上仅实现了 1.1% 的困惑度损失。

  20. TOOL · CL_100041 ·

    量化导致任务准确率下降 7 个点,绕过了困惑度

    一家名为 Nexus Labs 的公司发现,使用 GPTQ 将一个微调过的 14B 代理模型量化到 INT4,导致多步任务完成准确率显著下降 7 个点,尽管困惑度指标仅显示微小变化。这个问题在模型在多步中未能保持约束的长序列中尤为明显。因此,Nexus Labs 实施了一项新的评估流程,优先考虑特定领域的任务完成情况,而不是对任何推理级别的模型更改进行困惑度评估。