PulseAugur
实时 07:17:57
实体 quantization

quantization

PulseAugur coverage of quantization — every cluster mentioning quantization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 22
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 13
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 22 条
  1. TOOL · CL_211588 ·

    LLM量化:不止是比特缩减

    大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。

  2. TOOL · CL_206040 ·

    研究表明1比特编码可优化向量嵌入索引

    一篇新的研究论文探讨了通过聚类优化向量嵌入索引,重新审视降维、量化和维度剪枝。该研究提出在聚类前应用这些技术,并发现使用全精度向量并非必需。即使是1比特编码也能达到接近最优的聚类质量,显著将存储减少60倍并提高性能。

  3. TOOL · CL_197991 ·

    新研究量化了专家混合模型中的量化损伤

    一篇新的研究论文探讨了量化对专家混合(MoE)模型的影响,特别关注数值扰动如何导致路由翻转。该研究提出了一种量化这种路由中介损伤的方法,并发现试点测试中约三分之一的损伤可归因于路由问题。虽然检测机制可以识别翻转何时发生,但它无法区分有益和有害的翻转,这为选择性修复带来了障碍。

  4. RESEARCH · CL_198158 ·

    研究基准测试小型语言模型的可靠性:量化优于剪枝

    一篇新的研究论文探讨了小型语言模型(SLMs)的可靠性,通过比较预训练模型和压缩模型。研究发现,在保持可靠性方面,量化比网络剪枝更有效,包括公平性、鲁棒性、隐私和道德等方面。通过量化压缩可靠的大型语言模型(LLMs)可以得到比从头开始训练的SLMs更具可靠性和适应性的SLMs。此外,从可靠的教师模型进行知识蒸馏可以进一步提高SLMs的可靠性。

  5. RESEARCH · CL_195859 ·

    AI模型通过量化和剪枝实现小型化以提高效率

    量化和剪枝是用于减小大型AI模型(如ChatGPT和Midjourney)的规模和计算需求的技朧。这些方法降低了表示模型权重的数字的精度,将它们从32位浮点格式转换为较低精度的格式,如16位浮点、8位整数(INT8),甚至4位整数(INT4)。此过程显著减少了内存使用并加快了推理速度,使得在包括边缘设备在内的性能较低的硬件上部署这些模型成为可能,同时还降低了运营成本和能耗。

  6. TOOL · CL_191298 ·

    研究发现:大语言模型量化损害呈乘法效应,而非加法效应

    一篇新发表在arXiv上的研究论文探讨了量化对大语言模型(LLMs)的影响,发现量化造成的损害是乘法效应而非加法效应。这意味着,随着模型被压缩到更低的比特宽度,其决策裕度会缩小,导致工具使用和安全拒绝方面出现不可预测的失败,即使基准测试分数在很大程度上保持不变。该研究提出了一个统计模型,根据裕度缩小来预测这些失败,提供了一种比先前加性噪声假设更准确的方法。

  7. TOOL · CL_188497 ·

    Together 发布用于 API 概念的“学习”文档

    Together 推出了一个名为“学习”的新文档部分,以帮助开发人员理解其 API 背后的概念。该部分旨在深入探讨诸如首次字节响应时间 (TTFT)、上下文窗口、采样、微调、量化和部署权衡等主题。

  8. COMMENTARY · CL_152302 ·

    AI 与 LLM 术语表解释核心工程术语

    本文档是面向后端工程师的 AI 和 LLM 工程术语表。它定义了核心概念,如 tokens、context windows、inference 和 parameters,以及与 attention mechanisms 相关的专业术语,如 LoRA、quantization 和 KV cache。该术语表从实践层面解释这些术语,区分它们与研究或营销定义,以帮助日常工作。

  9. COMMENTARY · CL_146725 ·

    推理工程:LLM 运营中隐藏的成本驱动因素

    推理工程是 LLM 运营中一个关键但常被忽视的层面,通过管理量化、推测解码和 MoE 路由等因素,显著影响成本。FP8 KV 缓存和提示缓存等创新正在涌现,以优化 token 效率并降低费用。例如,一个使用 Claude Sonnet 4.6 的团队每月花费约 4,800 美元,其中模型本身占 960 美元,其余 3,840 美元归因于这一推理层。

  10. COMMENTARY · CL_138790 ·

    大语言模型推理速度受硬件物理限制,而非模型复杂度

    一篇文章探讨了大语言模型(LLM)推理的性能瓶颈,认为主要限制因素并非模型本身,而是硬件的底层物理限制,特别是内存带宽。文章解释说,GPU的设计是为了大规模并行处理,对大型数据集执行相同的操作,这对于AI工作负载至关重要。文章强调,LLM的推理速度取决于两个关键GPU资源中较慢的那个:计算能力和内存带宽,并引入了算力强度(arithmetic intensity)的概念来衡量这种关系。

  11. TOOL · CL_131652 ·

    新的CGVQ方法将图像压缩效率提高了20%

    研究人员开发了一种名为聚类引导矢量量化(CGVQ)的新方法,以提高基于二维高斯图元的图像压缩效率。该技术在量化之前将高斯参数划分为同质组,从而提高了率失真性能。实验表明,CGVQ在保持可比视觉质量的同时,每像素比特数可减少20%。

  12. RESEARCH · CL_117645 ·

    新研究应对大语言模型对齐、安全和优化挑战

    研究人员正在探索改进大语言模型(LLM)对齐和可靠性的新方法。一项研究发现字节对编码(BPE)分词中存在一个漏洞,该漏洞可能被利用来绕过安全机制,导致多个模型系列产生有害输出。另一篇论文提出了一个名为HAL的框架,通过优化明确的、可解释的对话特征来诱导大语言模型产生类似人类的对话行为。此外,一个名为Object Aligner的新库提供了一种可配置的方法来评估JSON模式相似度,这对于大语言模型提示优化和工具使用非常有用。最后,对大语…

  13. RESEARCH · CL_115212 ·

    SEADA方法优化多精度架构上的混合精度深度神经网络

    研究人员开发了SEADA,一种在多精度空间架构上优化深度神经网络(DNN)的新型方法。该方法通过提供一个可配置的成本模型、一个用于整数加速器的快速映射工具以及用于浮点层的分析模型,解决了混合精度网络映射的挑战。SEADA利用基于比特级熵的逐层精度选择来高效地分配数值精度,为设计者提供了一个探索多精度架构设计空间的强大框架。

  14. RESEARCH · CL_109544 ·

    研究发现:大语言模型量化会膨胀推理Token使用量

    一篇新的研究论文指出,尽管INT4和INT3等量化技术在降低大语言模型推理成本方面卓有成效,但它们可能会意外地膨胀推理Token的使用量。这种被称为“Token膨胀”的现象会抵消预期的加速效果,并带来隐藏的计算成本。该研究引入了“CoT Token膨胀率”来衡量这种效应,并提出量化感知训练可能是一种有前景的缓解策略。

  15. TOOL · CL_106885 ·

    指南解释了LLM的微调、LoRA和量化

    本文提供了一份关于微调大型语言模型的实用指南,重点介绍了LoRA(低秩适应)和量化等技术。它解释了当仅依赖API不足时,如何使用这些方法来调整预训练模型以适应特定任务。该指南旨在帮助开发人员根据其独特的应用需求定制LLM。

  16. RESEARCH · CL_106765 ·

    联邦学习研究聚焦量化、公平性和噪声问题 · 跟踪 4 个来源

    该研究论文集探讨了联邦学习(FL)的进展,这是一种用于分布式智能并保护数据隐私的方法。其中一篇论文全面回顾了量化技术,以解决 FL 的可扩展性问题,例如通信瓶颈和设备异构性。另一篇论文介绍了 FAIRVAR,一种新颖的方差正则化方法,通过减少客户端之间的性能差异来提高公平性。第三篇论文提出了 VRA-FedSGD,这是一种旨在处理大规模 FL 部署(特别是针对物联网设备)中普遍存在的重尾梯度和通信噪声的算法。

  17. COMMENTARY · CL_102107 ·

    量化:高效部署大语言模型的关键技术

    量化是将大语言模型(LLMs)的权重和激活值从浮点格式转换为低精度整数格式,从而实现高效部署的关键技术。此过程可减小内存占用和计算需求,使大语言模型适用于资源受限的设备。关键步骤包括权重和激活值的量化,采用均匀量化、非均匀量化和学习量化等方法会影响模型的准确性和效率。最小化量化误差(通过均方误差等指标衡量)对于保持模型性能至关重要。

  18. TOOL · CL_87068 ·

    本地 LLM 硬件指南:VRAM、量化与性能

    在本地运行大型语言模型(LLM),尤其是拥有 700 亿参数的模型,带来了严峻的硬件挑战,主要涉及 VRAM 容量。尽管营销宣传常暗示最低要求,但实际使用表明,将 70B 模型装入 8GB VRAM 必须进行大量优化,如量化。量化通过降低模型权重的比特表示来减小模型大小,对于在消费级硬件上运行这些模型至关重要,尽管它需要在内存使用、速度和输出质量之间进行权衡。使用 `nvidia-smi` 等工具监控 VRAM 使用情况对于理解 LL…

  19. RESEARCH · CL_84334 ·

    研究发现量化限制了密集检索的维度

    arXiv上发表的一项新的理论研究探讨了量化对密集 top-k 检索系统施加的限制。研究表明,使用每个坐标 B 比特实现完美检索需要嵌入维度随着语料库大小(N)的对数增长,这与先前在无限精度下假设的语料库独立性相矛盾。研究结果表明,随着数据语料库的扩展,实际的向量数据库和检索系统必须增加嵌入维度,并可能增加精度。

  20. TOOL · CL_67998 ·

    LLM量化基准测试可能忽略关键的工具调用失败

    Reddit的r/LocalLLaMA子版块上的一篇讨论,质疑了对量化大语言模型(LLM)仅以困惑度和文本质量进行基准测试的普遍做法。用户认为,这些指标可能无法准确反映模型在结构化任务中的表现,例如工具调用有效性,在这种任务中,即使是微小的量化错误也可能导致生成正确的JSON或遵守函数模式时出现致命的失败。该帖子呼吁进行专门衡量不同量化级别下有效工具调用接受率的基准测试,并认为基于文本的评估可能导致对智能体应用所需量化级别的假设低于实际情况。