Qwen团队发布了其Qwen3.8-Flash-Next模型的权重,这是一款多模态混合专家(MoE)架构模型。该新模型集成了多项创新,如Gated DeltaNet+Qwen Sparse Attention (GDN+QSA)混合、Gated Residual Networks、N-gram embedding和Muon优化器,旨在提高性能同时降低计算和训练成本。该模型支持262,144个token的基础上下文长度,可通过YaRN扩展至100万token,其权重可在Hugging Face和ModelScope上获取。 AI
影响 此次发布提供了更高的效率和显著更大的上下文窗口,可能支持更复杂的多模态应用。
排序理由 Qwen发布了带有系统卡的模型。 [lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
- Gated DeltaNet+Qwen Sparse Attention
- Gated Residual Networks with Dilated Convolutions for Monaural Speech Enhancement
- GDN+QSA
- Hugging Face
- ModelScope
- muon
- N-gram Embedding
- Qwen
- Qwen3.8-Flash-Next
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →