研究人员开发了一个名为 All for 1-Bit (AF1) 的新颖框架,以实现大型语言模型 (LLM) 的真正 1 位训练后量化。AF1 通过结合零空间感知二值分解 (NABF) 和分层 Shapley 分配 (HiSA) 来解决现有二值化方法超出标称 1 位存储目标的问题。在 LLaMA、Qwen 和 Gemma 等模型上的实验表明,AF1 在困惑度和准确性方面显著优于其他基于二值化的 PTQ 方法,同时与 bfloat16 相比,还提供了显著的推理速度提升和内存减少。 AI
影响 通过大幅降低存储和内存需求,实现更高效的 LLM 部署。
排序理由 详细介绍 LLM 量化新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- All for 1-Bit
- bfloat16
- Gemma
- Hierarchical Shapley Allocation
- LLaMA
- LLMs
- Null-space-Aware Binary Factorization
- Qwen
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →