PulseAugur
实时 12:39:07
实体 Qwen1.5-MoE-A2.7B

Qwen1.5-MoE-A2.7B

PulseAugur coverage of Qwen1.5-MoE-A2.7B — every cluster mentioning Qwen1.5-MoE-A2.7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_122974 ·

    新方法使用通用文本语料库剪枝MoE语言模型

    研究人员开发了一种名为Generic TB-Coverage的新方法,用于剪枝稀疏激活的专家混合(MoE)语言模型。该技术解决了在无需特定下游校准数据的情况下移除冗余专家的挑战。通过利用WikiText2和C4等通用文本语料库,Generic TB-Coverage分别在每个语料库上分析每个专家的效用,并确保保留每个语料库中的高效用专家。这种方法在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base等模型上,…

  2. TOOL · CL_127620 ·

    新的MoE剪枝方法使用通用数据来保留专家效用

    研究人员开发了一种名为 Generic TB-Coverage 的新方法,用于剪枝稀疏激活的混合专家(MoE)语言模型。该方法使用 WikiText2 和 C4 等通用文本语料库进行校准,这与依赖单一聚合重要性分数的现有方法不同。通过在每个语料库上单独分析每个专家的效用,并强制执行基于预算的覆盖规则,Generic TB-Coverage 在创建最终剪枝掩码之前保留了高效用专家。在 Qwen1.5-MoE-A2.7B 和 DeepSe…

  3. RESEARCH · CL_82096 ·

    AI研究质疑专家混合模型中的专家重要性指标

    一篇新的研究论文调查了可解释性方法在专家混合(MoE)模型中的有效性。研究发现,用于预测哪些专家可以被移除而不影响性能的常用指标,与因果专家重要性并不可靠地相关。在三种不同的MoE架构中,观察性数据未能预测专家的可替代性,这表明当前的剪枝技术可能由于冗余而不是精确识别关键组件而成功。