PulseAugur
中
实时 02:47:20
实体 Qwen1.5-MoE-A2.7B

Qwen1.5-MoE-A2.7B

PulseAugur coverage of Qwen1.5-MoE-A2.7B — every cluster mentioning Qwen1.5-MoE-A2.7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_227114 ·

    新研究探索用于效率的先进大模型量化技术

    几篇新研究论文探索了用于量化大语言模型(LLM)以提高部署效率的先进技术。REAL-Q 引入了一种动态梯度下降方法,以最小化端到端 KL 散度,在 LLaMA-3.1 和 Qwen3 上显示出显著的改进。HBQ 提出了一种具有有效数字缩放的分层方法,以最大化硬件效率和准确性,优于现有方法。Q-Strata 专注于混合精度量化,用于专家混合模型,优化专家之间的比特分配。另一篇论文研究了量化损伤的结构,表明全局比特分配通常优于局部修复,而…

  2. TOOL · CL_122974 ·

    新方法使用通用文本语料库剪枝MoE语言模型

    研究人员开发了一种名为Generic TB-Coverage的新方法,用于剪枝稀疏激活的专家混合(MoE)语言模型。该技术解决了在无需特定下游校准数据的情况下移除冗余专家的挑战。通过利用WikiText2和C4等通用文本语料库,Generic TB-Coverage分别在每个语料库上分析每个专家的效用,并确保保留每个语料库中的高效用专家。这种方法在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base等模型上,…

  3. TOOL · CL_127620 ·

    新的MoE剪枝方法使用通用数据来保留专家效用

    研究人员开发了一种名为 Generic TB-Coverage 的新方法,用于剪枝稀疏激活的混合专家(MoE)语言模型。该方法使用 WikiText2 和 C4 等通用文本语料库进行校准,这与依赖单一聚合重要性分数的现有方法不同。通过在每个语料库上单独分析每个专家的效用,并强制执行基于预算的覆盖规则,Generic TB-Coverage 在创建最终剪枝掩码之前保留了高效用专家。在 Qwen1.5-MoE-A2.7B 和 DeepSe…

  4. RESEARCH · CL_82096 ·

    AI研究质疑专家混合模型中的专家重要性指标

    一篇新的研究论文调查了可解释性方法在专家混合(MoE)模型中的有效性。研究发现,用于预测哪些专家可以被移除而不影响性能的常用指标,与因果专家重要性并不可靠地相关。在三种不同的MoE架构中,观察性数据未能预测专家的可替代性,这表明当前的剪枝技术可能由于冗余而不是精确识别关键组件而成功。