阿里巴巴的Qwen团队发布了Qwen3.8-Flash,这是一个开放权重的多模态模型,作为Qwen4架构的早期预览。该新模型在成本效益和性能方面都有显著提升,在各种基准测试中均优于其前身Qwen3.7-Plus,尤其是在编码和办公任务方面。关键架构升级包括混合注意力机制、门控残差网络和N-gram嵌入系统,这些都为其增强的功能和降低的计算成本做出了贡献。 AI
影响 在多个基准测试中设定了新的SOTA(State-of-the-Art),重点关注成本效益,可能影响未来的模型开发和部署策略。
排序理由 前沿实验室模型发布,附带系统卡和基准测试结果。
- Alibaba Group
- GSM8K
- MMLU-Pro
- Muon optimizer
- N-gram Embedding
- Qwen
- Qwen3.7-Plus
- Qwen3.8-Flash
- Qwen3.8-Flash-Next
- Qwen4
- QwenCloud
- Qwen Sparse Attention
- SuperGPQA
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →