deepseek-moe-16b-base
PulseAugur coverage of deepseek-moe-16b-base — every cluster mentioning deepseek-moe-16b-base across labs, papers, and developer communities, ranked by signal.
-
新方法使用通用文本语料库剪枝MoE语言模型
研究人员开发了一种名为Generic TB-Coverage的新方法,用于剪枝稀疏激活的专家混合(MoE)语言模型。该技术解决了在无需特定下游校准数据的情况下移除冗余专家的挑战。通过利用WikiText2和C4等通用文本语料库,Generic TB-Coverage分别在每个语料库上分析每个专家的效用,并确保保留每个语料库中的高效用专家。这种方法在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base等模型上,…
-
新的MoE剪枝方法使用通用数据来保留专家效用
研究人员开发了一种名为 Generic TB-Coverage 的新方法,用于剪枝稀疏激活的混合专家(MoE)语言模型。该方法使用 WikiText2 和 C4 等通用文本语料库进行校准,这与依赖单一聚合重要性分数的现有方法不同。通过在每个语料库上单独分析每个专家的效用,并强制执行基于预算的覆盖规则,Generic TB-Coverage 在创建最终剪枝掩码之前保留了高效用专家。在 Qwen1.5-MoE-A2.7B 和 DeepSe…
-
ConMoE框架无需重新训练即可压缩MoE模型
研究人员开发了ConMoE,一种无需重新训练即可压缩混合专家(MoE)语言模型的新颖框架。该方法通过将原始专家引用重新分配给一组较小的选定原型来合并专家池。ConMoE使用基于校准的信号来选择要保留的专家以及如何重新映射调用,从而保留了原始路由器接口。在deepseek-moe-16b-base和Qwen3-30B-A3B等模型上进行的实验表明,与现有的剪枝和合并技术相比,ConMoE实现了具有竞争力或更优越的压缩率。