一份新的技术报告介绍了 A.X K2,一个拥有 6880 亿参数的混合专家(MoE)语言模型,专为智能体应用而设计。尽管其训练的 token 数量少于其前身 A.X K1,但由于 token 效率的提高和更高质量的训练数据集,A.X K2 在各种基准测试中表现出显著的改进。该模型采用了稀疏门控注意力(SGA)等创新技术,以实现高效的长上下文处理,并采用了门控归一化(GN)技术以实现稳定的大规模训练,在 RULER 和数学任务等基准测试中取得了强劲的性能。 AI
影响 推出了一款新的大规模 MoE 模型,该模型在智能体应用和长上下文方面具有创新性,有望提升 LLM 的效率和能力。
排序理由 发布了一份详细介绍新型大型语言模型的技木报告。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- A.X K2
- Fp8
- Gated Norm
- Hugging Face
- mixture of experts
- NVFP4
- RULER
- Sparse Gated Attention
- Think-Fusion
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →