PulseAugur
实时 09:16:40
English(EN) Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

Bole系统通过树状推测加速混合注意力LLM推理

研究人员开发了Bole,一个旨在加速混合注意力大型语言模型(LLM)推理的新系统。这些模型结合了全注意力机制和循环线性注意力机制,以更有效地管理长上下文。Bole通过将线性注意力的循环转换为树状结构,实现了对推测性提议的并行验证,从而解决了这些模型中自回归解码的内存瓶颈问题。这种方法显著减少了瞬时内存使用量,并增加了GPU用于键值缓存的容量,从而大幅提高了解码吞吐量,并缩短了代理工作负载的首次令牌生成时间。 AI

影响 提高了LLM的推理速度和效率,可能支持更复杂的应用并降低运营成本。

排序理由 该集群包含一篇学术论文,详细介绍了提高LLM推理效率的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Bole系统通过树状推测加速混合注意力LLM推理

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Li Wang, Yi Su, Xiabao Wu, Chiran You, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng, Fangxin Liu, Jie Zhang, Chen Tian, Chengying Huan ·

    Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

    arXiv:2608.01651v1 Announce Type: cross Abstract: Hybrid-attention large language models combine full attention with recurrent linear attention to reduce long-context inference costs, yet their autoregressive decoding remains memory-bound. Tree speculative decoding offers an attr…