研究人员开发了Bole,一个旨在加速混合注意力大型语言模型(LLM)推理的新系统。这些模型结合了全注意力机制和循环线性注意力机制,以更有效地管理长上下文。Bole通过将线性注意力的循环转换为树状结构,实现了对推测性提议的并行验证,从而解决了这些模型中自回归解码的内存瓶颈问题。这种方法显著减少了瞬时内存使用量,并增加了GPU用于键值缓存的容量,从而大幅提高了解码吞吐量,并缩短了代理工作负载的首次令牌生成时间。 AI
影响 提高了LLM的推理速度和效率,可能支持更复杂的应用并降低运营成本。
排序理由 该集群包含一篇学术论文,详细介绍了提高LLM推理效率的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]
- autoregressive decoding
- Bole
- Full Attention
- graphics processing unit
- Hybrid-Attention Language Models
- Recurrent Linear Attention
- SGLang
- Tree Speculative Decoding
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →