2026年,开放权重专家混合(MoE)模型在总参数量与激活参数量之间出现了显著分化。这意味着决定内存需求和加载时间的总权重远大于决定每个token计算成本的激活权重。例如,Kimi K3拥有2.8万亿总参数,但仅激活约1040亿;而DeepSeek的V4.1-Flash拥有5520亿总参数,但仅激活80亿。这一趋势使得模型能够存储海量知识,同时保持每个token的计算成本可控,但通过创建独立的内存和计算预算,使预算和部署变得复杂。 AI
影响 MoE模型的这种架构转变,由于内存和计算成本现在是解耦的,因此需要新的策略来预算和部署AI系统。
排序理由 讨论开放权重模型架构和性能指标的趋势。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →