BigBird
PulseAugur coverage of BigBird — every cluster mentioning BigBird across labs, papers, and developer communities, ranked by signal.
-
滑动窗口注意力大幅降低 LLM 成本,实现更长上下文
滑动窗口注意力是一种将大型语言模型的计算成本从二次方降低到线性的技术,它通过将每个 token 的注意力限制在先前 token 的局部窗口内来实现。Longformer、Mistral 和 BigBird 等模型采用的这种方法显著降低了计算和内存需求,尤其是在长序列处理方面。通过堆叠多层,模型可以有效地获得更大的感受野,从而在不产生全自注意力带来的高昂成本的情况下处理和理解长距离依赖关系。
-
无参数稀疏注意力通过数据压缩实现效率提升
研究人员开发了一种新颖的、无需参数的自适应稀疏注意力方法,用于 Transformer 模型,利用数据压缩技术动态选择长程注意力相关的关键内容块。该方法借鉴了 GZIP 等经典压缩算法的思路,识别信息丰富且不易压缩的片段,从而在不增加可学习参数或专用硬件的情况下提高注意力效率。在 PG-19 数据集上的实验表明,与固定注意力模式和其他自适应方法相比,该方法在逐字节语言建模性能上有了显著提升,收敛速度更快,并且在处理长序列时具有更好的可扩展性。
-
大型语言模型通过注意力技巧应对长上下文挑战
大型语言模型中自注意力机制的二次方复杂度,即计算和内存随输入令牌数量的平方而扩展,对处理长上下文构成了重大挑战。各种技术旨在规避这一限制,包括滑动窗口注意力,它将每个令牌的关注范围限制在局部片段;以及注意力沉没(attention sinks),通过保持最初几个令牌的持续可见性来稳定流式处理。稀疏注意力结合了局部窗口与全局和跨步连接,使信息能够跨越更长的序列;而 RoPE 缩放调整位置嵌入,使在较短上下文上训练的模型能够处理扩展输入。
-
新的注意力方法应对大语言模型长上下文挑战
研究人员正在开发新的注意力机制来处理大型语言模型中日益增长的长上下文。一种方法,Runtime-Certified Bounded-Error Quantized Attention,使用分层 KV 缓存来压缩内存,同时保证回退到精确注意力,确保语言建模和检索等任务的质量。另一种方法,DashAttention,采用可微分稀疏分层注意力来适应性地选择相关 token,以与全注意力相当的准确性实现高稀疏度,并提供优于现有分层方法的性能。…