Wikitext2
PulseAugur coverage of Wikitext2 — every cluster mentioning Wikitext2 across labs, papers, and developer communities, ranked by signal.
-
新方法使用通用文本语料库剪枝MoE语言模型
研究人员开发了一种名为Generic TB-Coverage的新方法,用于剪枝稀疏激活的专家混合(MoE)语言模型。该技术解决了在无需特定下游校准数据的情况下移除冗余专家的挑战。通过利用WikiText2和C4等通用文本语料库,Generic TB-Coverage分别在每个语料库上分析每个专家的效用,并确保保留每个语料库中的高效用专家。这种方法在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base等模型上,…
-
新的MoE剪枝方法使用通用数据来保留专家效用
研究人员开发了一种名为 Generic TB-Coverage 的新方法,用于剪枝稀疏激活的混合专家(MoE)语言模型。该方法使用 WikiText2 和 C4 等通用文本语料库进行校准,这与依赖单一聚合重要性分数的现有方法不同。通过在每个语料库上单独分析每个专家的效用,并强制执行基于预算的覆盖规则,Generic TB-Coverage 在创建最终剪枝掩码之前保留了高效用专家。在 Qwen1.5-MoE-A2.7B 和 DeepSe…
-
新方法解决大语言模型量化问题,以提高效率和准确性
研究人员开发了多种通过量化提高大语言模型(LLM)效率的新方法。OSAQ 专注于利用低秩 Hessian 属性抑制权重异常值,实现精确的低比特仅权重量化。BWLA 引入了一个框架,用于 1 位权重量化和低比特激活,实现了显著的推理加速。AGoQ 通过采用感知层激活量化和 8 位梯度存储,以内存高效的方式进行分布式训练,减少了内存使用并提高了训练速度。