两篇新研究论文探讨了提高大型语言模型(LLM)效率的方法。第一篇论文《面向长上下文LLM解码的密集片上NVM的接口感知KV缓存量化》提出了一种针对非易失性存储器(NVM)接口优化的量化方案,旨在降低LLM解码的能耗和元数据开销。第二篇论文《PELM:通过推测性解码和动态电压频率调整实现设备端LLM推理的功耗优化》介绍了PELM系统,该系统结合了推测性解码和动态电压频率调整(DVFS)以提高设备端LLM推理的功耗效率,展示了显著的速度提升和能耗降低。 AI
影响 这些研究工作旨在使LLM在部署时更加易于访问和高效,特别是在资源受限的设备上,并降低能耗。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了提高LLM效率的新颖方法。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- dynamic voltage and frequency scaling
- Gotit.pub
- Hugging Face
- KV cache
- LLM
- ScienceCast
- speculative decoding
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →