研究人员开发了一种新颖的方法,可以在量化线性注意力语言模型中诱导稀疏神经活动,在不显著降低性能的情况下显著降低计算成本。该方法将低于可训练阈值的激活值置零,旨在优化大型语言模型以适应神经形态硬件。与边缘 GPU 推理相比,所提出的技术可实现高达 37 倍的吞吐量和 16 倍的功耗降低,使这些稀疏模型成为事件驱动多核平台的理想选择。 AI
影响 这项研究可以实现 LLM 在专用神经形态硬件上更高效的部署,从而降低功耗并提高推理速度。
排序理由 该集群包含一篇详细介绍语言模型优化新方法的学术论文。
在 arXiv cs.NE (Neural & Evolutionary) 阅读 →
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Event-Driven Language Models with Sparse Neural Activity for Neuromorphic Hardware
- Gotit.pub
- graphics processing unit
- Hugging Face
- Influence Flower
- KV cache
- large language models
- ScienceCast
- SQL Server Management Studio
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →