Motif Technologies 发布了 Motif 3,这是一款拥有 3140 亿总参数和每个 token 激活 132 亿参数的 decoder-only 混合专家(Mixture-of-Experts)语言模型。该模型采用了新颖的 Grouped Differential Latent Attention 架构,并在约 12.5 万亿个 token 上进行了训练。Motif 3 在与领先的开源模型相比时,表现出具有竞争力的性能,尤其在长时序代理任务、数学推理和科学知识方面表现出色。 AI
影响 为开源模型树立了新的基准,尤其是在代理任务和推理方面,可能影响未来的模型开发。
排序理由 关于新大型语言模型发布的技术报告及相关材料。
在 Hugging Face Daily Papers 阅读 →
- A.X Series
- EXAONE Series
- LG AI Research
- Motif Technologies
- Qwen 3.7 Max
- Solar Series
- Upstage
- arXiv
- Expert Specific PolyNorm
- Grouped Differential Latent Attention
- Hugging Face
- Motif 3
- Multi-Teacher On-Policy Distillation
- MXFP8
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →