sliding-window attention
PulseAugur coverage of sliding-window attention — every cluster mentioning sliding-window attention across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
小米的MiMo-V2-Flash凭借高效的MoE架构引领开源编码基准测试
小米开发了MiMo-V2-Flash,一个拥有3090亿参数的混合专家(MoE)模型,在编码任务的SWE-Bench上领先于其他开源选项。该模型通过混合注意力(hybrid attention)和用于更快解码的多令牌预测模块(multi-token prediction module)等架构创新,以显著降低的计算成本实现了高性能。此外,一种名为多教师策略优化蒸馏(Multi-Teacher On-Policy Distillation…
-
小米详解 MiMo-V2.5 AI 模型效率优化
小米公司详细介绍了其 MiMo-V2.5 系列 AI 模型背后的工程优化,重点在于实现长上下文推理和多模态任务的效率。与传统的全注意力机制相比,该模型采用混合滑动窗口注意力(Hybrid SWA)来大幅降低 KVCache 的存储和计算成本。进一步的增强包括稀疏 MoE 激活以减少每 token 的计算量,以及用于跨模态理解的多模态编码器。该公司系统地设计了推理系统,以在生产环境中实现这些架构优势,解决了 KVCache 管理、调度和…
-
开源AI中Transformer注意力机制的演进
自诞生以来,Transformer架构的注意力机制经历了显著的演进,众多创新为更高效、更强大的大型语言模型做出了贡献。FlashAttention、多查询注意力(MQA)、分组查询注意力(GQA)和滑动窗口注意力(SWA)等创新极大地降低了内存需求并提高了推理性能。最新的进展,包括门控Delta网络(GDNs)等线性注意力变体和原生稀疏注意力(DSA)等稀疏注意力方法,正在进一步拓展边界,许多开源模型都采用了这些技术。
-
研究重新思考混合语言模型中的高效注意力机制
一篇新的研究论文分析了语言模型中的混合架构,该架构结合了全注意力机制和滑动窗口注意力(SWA)等高效注意力模块。研究发现,高效注意力主要影响长上下文能力出现的速度,而不是最终性能,后者在充分训练后往往会在不同的混合设计中趋于一致。研究人员还发现了一种称为“大窗口惰性”的现象,即较大的SWA窗口会减缓全注意力层中检索头的发展。该论文提出,在SWA混合模型中仅将位置编码应用于全注意力层,以增强长上下文性能,同时不降低短上下文能力。
-
模糊窗口注意力提高了Transformer处理长上下文的效率
研究人员推出了一种新方法——模糊窗口注意力(BLA),旨在提高Transformer语言模型处理长上下文的效率。BLA通过使用狄利克雷核从频率窗口重建模糊的KV历史,解决了标准Softmax注意力的二次复杂度和不断增长的KV缓存大小限制。该方法在滑动窗口注意力方面提供了状态效率的改进,并在需要信息检索的任务上保持了与其他线性注意力模型相当的性能。
-
Transformer 模型通过因果掩码和残差流获得绝对位置感知能力
研究人员在 decoder-only Transformer 中识别出两个关键的架构组件,它们有助于模型区分绝对位置,尽管 RoPE 等位置编码方法主要编码相对偏移。这两个组件是因果掩码(其 softmax 分母本身就依赖于查询位置)和残差流(它在位置 0 处充当动态系统)。该研究分析了不同的架构选择(如 NTK 缩放和滑动窗口注意力)如何与这些组件相互作用,从而影响模型的绝对位置感知能力。
-
开源大模型演进:注意力机制、多模态和效率提升
近几个月来,开源大模型领域发生了重大变化,滑动窗口注意力机制已成为主流,支持更大的上下文窗口。QK-Norm 也因其作为训练稳定器的作用而受到关注,其根源可追溯至 Gemini 3 的架构。Kimi k2.5 中早期出现的多模态预训练,已被证明有利于推理,而 Z.ai 的 GLM-5,尽管经过修改,但性能可与顶级闭源模型相媲美。Step 3.5 Flash 在推理速度和多令牌预测方面表现突出,尽管基准测试性能并不总是与用户偏好一致。