两篇新研究论文提出了加速大语言模型(LLMs)解码过程的方法。第一篇论文介绍了稀疏非对称分组查询注意力(SAGA),它减少了键头的数量,同时保留了更多的价值头以提高效率,实现了2倍以上的加速,且质量损失极小。第二篇论文SpAx通过结合激活稀疏性和权重近似来解决在内存有限的硬件上部署LLMs的挑战,当权重被卸载到CPU内存或闪存时,可以显著加速。 AI
影响 这些技术可以显著降低LLM推理的计算成本和延迟,从而在资源受限的硬件上实现更广泛的部署。
排序理由 两篇在arXiv上发表的学术论文,提出了提高LLM解码效率的新颖方法。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- graphics processing unit
- Hugging Face
- IArxiv
- LLM
- ScienceCast
- WikiText-2
- central processing unit
- GQA
- large-language models
- Noam Elata
- SAGA
- Sparse Asymmetric Group-Query Attention
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →