PulseAugur
实时 08:36:04
English(EN) GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries

GaugeQuant 通过学习模型对称性来优化大语言模型量化

研究人员开发了 GaugeQuant,一种利用大语言模型(LLMs)内部对称性来优化其量化过程的新颖方法。该技术在训练损失中引入了一个 LogSumExp 项,引导模型选择量化最优基,而无需校准数据或模拟。在 W4A4 量化下对 LLaMA-2 7B 模型进行的实验显示,困惑度从 8.22 显著降低到 6.73,优于一些训练后量化方法。在 W4A16 量化下观察到进一步改进,困惑度从 11.16 下降到 5.45。 AI

影响 该方法可以通过减少大语言模型的内存占用和计算需求,同时不牺牲性能,从而实现更高效的大语言模型部署。

排序理由 该集群描述了一篇详细介绍一种新颖的 LLM 量化优化方法的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

GaugeQuant 通过学习模型对称性来优化大语言模型量化

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Miguel P. Bento, Jo\~ao Seabra ·

    GaugeQuant: 从大语言模型对称性中在线学习量化最优基

    arXiv:2607.20757v1 Announce Type: cross Abstract: Transformers are known to have internal continuous symmetries that leave outputs invariant, while modifying quantization. GaugeQuant leverages this in-training by introducing a LogSumExp term to the loss that breaks the symmetries…