PulseAugur
实时 19:08:20
中文(ZH) 苏神复盘 Kimi K3:896 个专家背后,藏着哪些关键技术取舍?

Kimi K3 采用 896 个专家和混合注意力机制实现高效扩展

Kimi K3 是一个拥有 2.8 万亿参数的模型,它采用了一种新颖的方法来管理其庞大的规模,即每个 token 只激活 896 个路由专家中的 16 个。研究员苏剑林详细介绍了这一策略,旨在控制计算成本,尽管参数量和上下文长度有所增加。该模型集成了 LatentMoE 以减少专家计算和通信,并结合了 RMSNormSiTU-GLU 等机制,以在低精度训练期间保持数值稳定性。其注意力架构结合了 KDA 用于连续状态维护和 MLA 用于全局检索,以及一个门控机制来过滤结果,同时最大限度地减少了部署的结构性变化。 AI

影响 引入了高效扩展大型模型的新颖技术,可能影响未来的 LLM 架构。

排序理由 研究员讨论技术选择的模型发布细节。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 雷峰网 (Leiphone) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Kimi K3 采用 896 个专家和混合注意力机制实现高效扩展

报道来源 [1]

  1. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    Su Shen reviews Kimi K3: Behind 896 experts, what key technology trade-offs are hidden?

    <section style="text-align: center; margin: 0px 16px; line-height: 1.75em; display: block;"><img class="rich_pages wxw-img" src="https://static.leiphone.com/uploads/new/images/20260806/6a748fc003c9c.jpg?imageMogr2/quality/90" style="width: 100%; display: inline-block; text-align:…