Scaled Dot-Product Attention
PulseAugur coverage of Scaled Dot-Product Attention — every cluster mentioning Scaled Dot-Product Attention across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
多头注意力机制:现代大语言模型的核心
多头注意力机制是Transformer架构中的一项关键创新,它使现代大语言模型(LLMs)能够并行处理序列并理解长距离依赖关系。与之前的RNN和CNN等方法不同,它允许模型通过多个注意力头同时关注输入的不同部分,每个注意力头都能学习到数据中不同的视角。这种基于缩放点积注意力(Scaled Dot-Product Attention)的机制显著提高了在GPU上的训练效率,并增强了模型理解复杂语言细微差别以完成机器翻译等任务的能力。
-
SSOG-Attention 提供可扩展的SDPA替代方案,降低了复杂性
研究人员开发了SSOG-Attention,这是一种新颖的方法,提供了标准缩放点积注意力(SDPA)的次二次方且可扩展的替代方案。通过学习高斯原子并基于查询令牌对其进行几何引导,SSOG-Attention将计算复杂度从O(N²·d)降低到O(N·√N·d)。实验表明,SSOG-Attention在CIFAR-100等较小数据集上优于SDPA,并在ImageNet-1K等较大数据集上以更快的收敛速度达到同等性能,同时在规模化时也更节省内存。
-
新的幂律图注意力通过学习算子泛化SDPA
研究人员引入了一种名为幂律图注意力(PLGA)的新型注意力机制,它通过使用学习到的、由输入生成的双线性算子来泛化缩放点积注意力(SDPA)。这种新架构在论文中进行了详细介绍,并与参考版本进行了验证,它用应用于正张量的逐元素幂律取代了固定形式。这项工作包括了推理崩溃定理和测量不变性,表明精确的输入不变性可以导致具有常数算子的广义SDPA。部分核心组件的证明已使用Lean 4编程语言进行了机器检查。