Qwen Sparse Attention
PulseAugur coverage of Qwen Sparse Attention — every cluster mentioning Qwen Sparse Attention across labs, papers, and developer communities, ranked by signal.
-
阿里巴巴预览Qwen4,采用新颖的逐层嵌入和稀疏注意力技术
阿里巴巴的Qwen团队发布了Qwen4-Exp,这是一个预览即将推出的Qwen4系列架构的实验模型。该模型引入了新颖的设计选择,包括逐层嵌入(PLE)和Qwen稀疏注意力(QSA),旨在在计算成本不成比例增加的情况下提高容量。PLE系统利用存储在主机RAM中的大型N-gram嵌入表,以最小的GPU影响提供显著的表示优势,并得到llama.cpp等框架的支持以进行CPU卸载。QSA通过在块级别而非令牌级别操作来提高效率,显著加快了长上下…
-
Qwen3.8-Flash-Next 架构详解,效率和稳定性有所提升 · 已追踪 2 个来源
研究人员详细介绍了 Qwen3.8-Flash-Next 的架构,这是一个拥有 125B 参数的稀疏专家混合模型。与前代 397B-A17B 模型相比,该新模型通过激活参数、训练 token 和 FLOPs 的一小部分,展示了更高的效率和稳定性。关键创新包括混合注意力机制、门控残差网络以及加速器外的 n-gram 嵌入,这些共同提升了性能和训练动态。
-
阿里巴巴预览Qwen4架构,推出成本效益高的Qwen3.8-Flash-Next模型
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是一个开放权重的多模态MoE模型,预览了即将推出的Qwen4的架构。该新模型拥有显著的成本效益,在125B的骨干网络中每个token仅激活6B参数,并额外包含51B的N-gram嵌入。它在包括编码和多模态任务在内的各种基准测试中表现强劲,同时提供原生262K上下文窗口,可扩展至1M token。该架构引入了Qwen Sparse Attention (QSA) 和 G…