PulseAugur
实时 18:24:25
English(EN) Half the Experts, All the Code: One-Shot Domain Pruning of Mixture-of-Experts LLMs for Coding

研究人员将LLM专家数量减半,编码能力无损

研究人员开发了一种方法,可以显著剪枝混合专家(MoE)大型语言模型,特别是针对编码能力。通过移除模型中多达一半的专家,他们在Qwen3.6 35B-A3B和Gemma 4 26B-A4B等基准测试中未发现编码性能有统计学上的显著损失。然而,最优剪枝策略在不同模型家族之间存在差异,表明需要进行特定任务的验证。该研究还强调,困惑度等传统指标可能具有误导性,并且虽然微调可以恢复部分性能损失,但剪枝仍然比激进的量化更有效。 AI

影响 这项研究通过在不牺牲性能的情况下减小大型编码模型的内存占用,有望在消费级硬件上实现更高效的部署。

排序理由 详细介绍LLM剪枝新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究人员将LLM专家数量减半,编码能力无损

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Anik Jha ·

    专家减半,代码全留:面向编程的混合专家大模型的单次领域剪枝

    arXiv:2607.16721v1 Announce Type: new Abstract: The strongest open-weight coding models are mixture-of-experts (MoE) networks: most of their size comes from large pools of "expert" subnetworks, of which only a few act on any token. That pool is why these models do not fit on the …