研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升高达2.01倍。该方法在Qwen3.6-35B和Kimi-Linear-48B等模型上进行了评估,证明了其在各种推理和代码生成任务中的有效性。 AI
影响 降低了具有循环状态的LLM的内存和延迟,可能在现有硬件上实现更大的模型或更快的推理。
排序理由 详细介绍LLM量化新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →