研究人员开发了一种名为 SpAx 的新方法,以提高大型语言模型 (LLM) 在其权重从 GPU 内存卸载时的效率。该技术引入了一种三层方法:根据激活稀疏性,完全保留权重、用压缩表示近似权重或完全省略权重。SpAx 旨在减少从系统 RAM 或闪存等较慢存储器频繁传输权重的需求,从而在最小化模型质量下降的同时加速解码速度。 AI
影响 该方法可以显著降低在内存有限的硬件上运行大型语言模型的计算成本和延迟。
排序理由 学术论文,详细介绍了 LLM 推理优化的一种新颖方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →