研究人员详细介绍了 Qwen3.8-Flash-Next 的架构,这是一个拥有 125B 参数的稀疏专家混合模型。与前代 397B-A17B 模型相比,该新模型通过激活参数、训练 token 和 FLOPs 的一小部分,展示了更高的效率和稳定性。关键创新包括混合注意力机制、门控残差网络以及加速器外的 n-gram 嵌入,这些共同提升了性能和训练动态。 AI
影响 为稀疏模型引入了架构创新,有望提高未来大型语言模型的效率和稳定性。
排序理由 该集群描述了一篇详细介绍新模型架构的研究论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →