Kimi K3 是一个拥有 2.8 万亿参数的模型,它采用了一种新颖的方法来管理其庞大的规模,即每个 token 只激活 896 个路由专家中的 16 个。研究员苏剑林详细介绍了这一策略,旨在控制计算成本,尽管参数量和上下文长度有所增加。该模型集成了 LatentMoE 以减少专家计算和通信,并结合了 RMSNorm 和 SiTU-GLU 等机制,以在低精度训练期间保持数值稳定性。其注意力架构结合了 KDA 用于连续状态维护和 MLA 用于全局检索,以及一个门控机制来过滤结果,同时最大限度地减少了部署的结构性变化。 AI
影响 引入了高效扩展大型模型的新颖技术,可能影响未来的 LLM 架构。
排序理由 研究员讨论技术选择的模型发布细节。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →