Kimi K3 发布了其技术报告,详细介绍了旨在提高大型语言模型效率和可扩展性的重大架构创新,特别是在长上下文任务和代理操作方面。该模型引入了 Kimi Delta Attention (KDA),通过使用压缩的递归状态而非完整的 KV 缓存来管理长序列,以及用于定期检查完整上下文的 Gated Multi-Layer Attention (MLA)。Attention Residuals (AttnRes) 允许更深的网络选择性地访问早期层的信息,解决了深度模型中的信息压缩问题。对于宽度扩展,LatentMoE 在专家处理之前压缩隐藏状态,降低了通信开销,而 SiTU-GLU 减轻了激活溢出风险。训练系统还结合了部分回滚和令牌级正则化用于强化学习,使代理能够通过暂停和恢复执行来处理长而异步的任务,并保留外部环境状态以实现无缝任务恢复。 AI
影响 引入了可能提高长上下文处理和代理任务效率及可扩展性的新颖架构组件。
排序理由 前沿实验室模型发布,附带系统卡 [lever_c 从 frontier_release 降级:ic=1 ai=1.0]
- Attention Residuals
- Innu-aimun
- Kimi Delta Attention
- Kimi K2
- Kimi K3
- LatentMoE
- SiTU-GLU
- SwiGLU
- Transformer++
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →