PulseAugur
中
实时 21:22:53
实体 Qwen Sparse Attention

Qwen Sparse Attention

PulseAugur coverage of Qwen Sparse Attention — every cluster mentioning Qwen Sparse Attention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. SIGNIFICANT · CL_228024 ·

    阿里巴巴预览Qwen4,采用新颖的逐层嵌入和稀疏注意力技术

    阿里巴巴的Qwen团队发布了Qwen4-Exp,这是一个预览即将推出的Qwen4系列架构的实验模型。该模型引入了新颖的设计选择,包括逐层嵌入(PLE)和Qwen稀疏注意力(QSA),旨在在计算成本不成比例增加的情况下提高容量。PLE系统利用存储在主机RAM中的大型N-gram嵌入表,以最小的GPU影响提供显著的表示优势,并得到llama.cpp等框架的支持以进行CPU卸载。QSA通过在块级别而非令牌级别操作来提高效率,显著加快了长上下…

  2. RESEARCH · CL_229109 ·

    Qwen3.8-Flash-Next 架构详解,效率和稳定性有所提升 · 已追踪 2 个来源

    研究人员详细介绍了 Qwen3.8-Flash-Next 的架构,这是一个拥有 125B 参数的稀疏专家混合模型。与前代 397B-A17B 模型相比,该新模型通过激活参数、训练 token 和 FLOPs 的一小部分,展示了更高的效率和稳定性。关键创新包括混合注意力机制、门控残差网络以及加速器外的 n-gram 嵌入,这些共同提升了性能和训练动态。

  3. FRONTIER RELEASE · CL_219957 ·

    阿里巴巴预览Qwen4架构,推出成本效益高的Qwen3.8-Flash-Next模型

    阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是一个开放权重的多模态MoE模型,预览了即将推出的Qwen4的架构。该新模型拥有显著的成本效益,在125B的骨干网络中每个token仅激活6B参数,并额外包含51B的N-gram嵌入。它在包括编码和多模态任务在内的各种基准测试中表现强劲,同时提供原生262K上下文窗口,可扩展至1M token。该架构引入了Qwen Sparse Attention (QSA) 和 G…