PulseAugur
中
实时 21:22:23
实体 N-gram Embedding

N-gram Embedding

PulseAugur coverage of N-gram Embedding — every cluster mentioning N-gram Embedding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. SIGNIFICANT · CL_230970 ·

    Qwen发布Qwen3.8-Flash-Next多模态MoE模型,支持1M上下文

    Qwen团队发布了其Qwen3.8-Flash-Next模型的权重,这是一款多模态混合专家(MoE)架构模型。该新模型集成了多项创新,如Gated DeltaNet+Qwen Sparse Attention (GDN+QSA)混合、Gated Residual Networks、N-gram embedding和Muon优化器,旨在提高性能同时降低计算和训练成本。该模型支持262,144个token的基础上下文长度,可通过YaRN扩…

  2. SIGNIFICANT · CL_220944 ·

    阿里巴巴 Qwen 团队宣布支持新架构,集成 TokenSpeed

    阿里巴巴 Qwen 团队宣布支持其新架构,包括 GDN + QSA、N-gram 嵌入和 FP8 精度。此支持由 lightseekorg 提供,后者为 TokenSpeed 提供了首日集成。公告还预告了 Qwen 4 即将进行的优化。

  3. FRONTIER RELEASE · CL_220151 ·

    阿里发布Qwen3.8-Flash-Next,成本大降、性能飙升 · 追踪6个来源

    阿里已发布并开源Qwen3.8-Flash-Next,这是一款多模态的混合专家模型,预览了即将推出的Qwen4架构。该新模型拥有1250亿总参数,但每个token仅激活60亿参数,显著降低了训练和推理成本。据报道,Qwen3.8-Flash-Next在包括编码和办公任务在内的多项基准测试中,性能超越了Claude Opus 4.6和DeepSeek-V4-Flash等竞争对手,同时API定价也大幅降低。

  4. FRONTIER RELEASE · CL_219957 ·

    阿里巴巴预览Qwen4架构,推出成本效益高的Qwen3.8-Flash-Next模型

    阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是一个开放权重的多模态MoE模型,预览了即将推出的Qwen4的架构。该新模型拥有显著的成本效益,在125B的骨干网络中每个token仅激活6B参数,并额外包含51B的N-gram嵌入。它在包括编码和多模态任务在内的各种基准测试中表现强劲,同时提供原生262K上下文窗口,可扩展至1M token。该架构引入了Qwen Sparse Attention (QSA) 和 G…