实体
DeepSeek-MoE-16B
DeepSeek-MoE-16B
PulseAugur coverage of DeepSeek-MoE-16B — every cluster mentioning DeepSeek-MoE-16B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
MAPLE框架优化MoE LLM专家分配以提高效率
研究人员开发了MAPLE,一个新颖的框架,旨在优化混合专家(MoE)Transformer模型中专家的分配。与将专家均匀分布在所有层中的传统方法不同,MAPLE根据层级敏感性自适应地重新分配专家预算。这种即插即用方法在不改变模型权重或需要重新训练的情况下提高了性能。实验表明,MAPLE在DeepSeek-MoE-16B等模型上提高了准确性,并显著降低了服务延迟和提高了吞吐量。
-
新工具DODOCO揭示MoE模型调度基准测试中的缺陷
一项新的研究论文介绍DODOCO,一个旨在诊断混合专家(MoE)模型调度操作中开销的工具。研究发现,关于基准测试中工作负载表示的常见假设以及系统层对路由不平衡的可纠正性是存在缺陷的。研究强调,模型架构,而非专家并行度,是决定性能区间的首要因素。