阿里巴巴的Qwen团队发布了Qwen4-Exp,这是一个预览即将推出的Qwen4系列架构的实验模型。该模型引入了新颖的设计选择,包括逐层嵌入(PLE)和Qwen稀疏注意力(QSA),旨在在计算成本不成比例增加的情况下提高容量。PLE系统利用存储在主机RAM中的大型N-gram嵌入表,以最小的GPU影响提供显著的表示优势,并得到llama.cpp等框架的支持以进行CPU卸载。QSA通过在块级别而非令牌级别操作来提高效率,显著加快了长上下文的预填充和解码时间。 AI
影响 引入了新颖的架构方法,可能显著降低大型语言模型的计算成本。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- Alibaba Group
- Gated Residual Networks with Dilated Convolutions for Monaural Speech Enhancement
- Hugging Face Transformers
- llama.cpp
- Multi Token Prediction
- Per-Layer Embedding
- Qwen3.8-Flash-Next
- Qwen4
- Qwen4-Exp
- Qwen Sparse Attention
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →