两篇新的研究论文提出了用于大型语言模型(LLM)训练后量化(PTQ)的新颖方法,旨在减小它们的尺寸和计算需求。第一篇论文《From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization》介绍了交错跨块量化(ICBQ),该方法通过两次重新访问来精炼量化边界。第二篇论文《ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization》提出了ReQuant,这是一种即插即用的精炼过程,在初始量化步骤后迭代优化离散权重分配。这两种方法都旨在提高量化模型的性能,尤其是在较低的比特宽度下,并且可以与现有的PTQ流程集成。 AI
影响 这些技术可以显著减小LLM的计算和内存占用,使其在部署时更易于访问和更高效。
排序理由 两篇在arXiv上发表的学术论文,提出了新的LLM量化方法。
- GPTAQ
- large-language models
- Post-training quantization (PTQ)
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- GPTQ
- Hugging Face
- Interleaved Cross-Block Quantization
- ScienceCast
- Sequential CBQ
- Transformer++
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →