DeepSeek MoE
PulseAugur coverage of DeepSeek MoE — every cluster mentioning DeepSeek MoE across labs, papers, and developer communities, ranked by signal.
-
专家混合:内存权衡下的性能提升
专家混合(MoE)模型通过仅激活其参数的子集,提供了一种以较低的每token计算成本实现高性能的方法。虽然像Mixtral 8x7B、DeepSeek-MoE和Qwen2.5-MoE这样的模型拥有庞大的总参数量,但它们仅利用其中一小部分来处理每个token。这种架构差异意味着MoE模型需要大量内存来存储所有参数,但在加载后可以节省计算资源,与密集模型相比,在内存和计算效率之间进行了权衡。
-
JetBrains 发布高效 Mellum2 MoE 模型;研究推动 MoE 技术进步
JetBrains 发布了 Mellum2,一个开源的 120 亿参数专家混合(MoE)模型,针对文本和代码任务的高效推理进行了优化。该模型每个 token 只激活其参数的一小部分,从而实现更快、更低延迟的操作,适用于大型 AI 系统中的路由、RAG 管道和子代理任务。多篇研究论文还探讨了 MoE 架构的进展,包括 CRAFT 等高效服务技术、DAG-MoE 等新颖聚合方法、Kappa-SwiGLU 的自适应门控以及 ProbMoE …
-
HEAPr算法精确剪枝LLM专家,降低内存需求
研究人员开发了HEAPr,一种旨在减少混合专家(MoE)大型语言模型内存占用的新剪枝算法。与之前剪枝整个专家的旧方法不同,HEAPr将专家分解为更小的原子单元。这种方法利用原子专家输出的二阶信息,显著降低了计算复杂度,并实现了在精度损失最小的情况下进行更精确的压缩。在DeepSeek MoE和Qwen MoE等模型上的实验表明,HEAPr在高达25%的剪枝率下可以实现近乎无损的压缩,并将浮点运算次数(FLOPs)降低相似的幅度。
-
新框架增强了在嘈杂模拟硬件上的 MoE LLM
研究人员推出 ROMER,一个训练后校准框架,旨在增强混合专家(MoE)大型语言模型(LLM)在模拟内存计算(CIM)系统上部署时的鲁棒性。该框架通过替换利用率不足的专家并重新校准路由器决策,以在嘈杂条件下维持负载平衡和最佳路由,从而解决 CIM 中的硬件缺陷。实验表明,ROMER 在 DeepSeek-MoE、Qwen-MoE 和 OLMoE 等模型在真实芯片噪声下时,显著降低了困惑度。