autoregressive decoding
PulseAugur coverage of autoregressive decoding — every cluster mentioning autoregressive decoding across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Bole系统通过树状推测加速混合注意力LLM推理
研究人员开发了Bole,一个旨在加速混合注意力大型语言模型(LLM)推理的新系统。这些模型结合了全注意力机制和循环线性注意力机制,以更有效地管理长上下文。Bole通过将线性注意力的循环转换为树状结构,实现了对推测性提议的并行验证,从而解决了这些模型中自回归解码的内存瓶颈问题。这种方法显著减少了瞬时内存使用量,并增加了GPU用于键值缓存的容量,从而大幅提高了解码吞吐量,并缩短了代理工作负载的首次令牌生成时间。
-
LLM推理成本由内存带宽驱动,而非计算
大型语言模型推理的主要成本驱动因素不是计算能力(FLOPs),而是内存带宽,尤其是在处理自回归解码过程中的KV缓存时。仅优化计算利用率会导致过度支出,因为与KV缓存所需的数据移动相比,每个token的实际算术运算非常少。需要进行架构更改,例如将预填充与解码分离,以及调整批处理大小和上下文大小,将内存带宽视为稀缺资源来有效管理成本。
-
新的CLP方法在不损失质量的情况下加速LLM推理
研究人员开发了一种名为搭配长度预测(CLP)的新方法来加速大型语言模型推理。CLP解决了多令牌预测(MTP)中的一个核心问题,即后续令牌的预测头会干扰主要的语言模型头,导致质量下降。通过重新设计架构,使主头始终生成第一个令牌,而一个轻量级的CLP层预测后续令牌,该方法在不牺牲输出质量的情况下实现了显著的加速。在Qwen2.5模型上的实验表明,重复率可忽略不计的情况下,速度提升高达1.29倍。