Mixture of Experts (MoE)
PulseAugur coverage of Mixture of Experts (MoE) — every cluster mentioning Mixture of Experts (MoE) across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
MoE research is increasingly focusing on dynamic expert selection and adaptation
Multiple recent papers introduce frameworks like ZEDA, Dynamic TMoE, and EMO that emphasize dynamic adjustments to the expert pool or routing mechanisms. ZEDA allows skipping experts, EMO progressively expands the pool, and Dynamic TMoE adapts experts based on distribution shifts. This trend indicates a shift from static MoE architectures towards more adaptive and efficient dynamic systems.
MoE efficiency frameworks (ZEDA, EMO) to see wider adoption in open-source models within 6 months
Recent research highlights multiple frameworks (ZEDA, EMO) focused on improving MoE efficiency through techniques like expert skipping and progressive expansion. The mention of MoE in Hugging Face's recent AI advancements suggests growing interest in the architecture. These efficiency gains are likely to be integrated into popular open-source MoE models to reduce inference costs and improve training times, making them more accessible.
Frameworks for MoE hyperparameter optimization (like Complete-muE) will become crucial for scaling MoE deployments
The introduction of Complete-muE specifically addresses the challenge of hyperparameter transfer in MoE models. As MoE architectures grow in complexity and size, efficiently tuning and transferring hyperparameters across different configurations will be essential for practical deployment and achieving optimal performance. This suggests a growing need for specialized tools to manage MoE at scale.
-
Mistral AI发布具有100万token上下文窗口的Mistral Large 4
Mistral AI发布了Mistral Large 4,这是一款新的开放权重多模态模型,目前处于公开预览阶段。该模型拥有1.05万亿参数,采用了专家混合(MoE)架构,每个token仅激活490亿参数。它包含一个16亿参数的视觉编码器用于图像处理,并支持一百万token的上下文窗口。
-
MaskCoFT 微调提升 MoE 模型推理效率
研究人员开发了 MaskCoFT,一种旨在提高专家混合(MoE)语言模型在推理过程中效率的新型微调方法。该技术同时训练模型的路由器和专家,使它们能够相互适应。通过使用可学习的掩码来限制专家选择,MaskCoFT 减少了每个 token 的专家获取次数,并显著缩短了输出生成所需的时间。该方法在多个基准测试中保持了高准确性,证明了其在内存受限环境中优化 MoE 模型的有效性。
-
使用llama.cpp通过专家卸载在RTX 4090上运行100B+ MoE LLM
一份技术指南详细介绍了如何在单块RTX 4090等消费级GPU上运行大型混合专家(MoE)语言模型,特别是超过1000亿参数的模型。该方法被称为“专家卸载”,利用了MoE架构,其中每个token只激活模型参数的一个子集。这使得计算密集但间歇使用的“专家”层可以卸载到系统内存中,而持续访问的组件(如注意力机制)则保留在GPU上。该指南提供了硬件建议、llama.cpp工具的构建说明以及实现此卸载技术的命令行示例,并强调系统内存带宽是性能的关键因素。
-
新的SCOOT算法利用精英样本和MoE解决高风险运动控制问题
研究人员开发了一种名为状态条件射击(SCOOT)的新型深度强化学习算法,专为高风险、高精度运动控制任务设计。与通常可以纠正错误的DRL应用不同,SCOOT解决了具有不可逆动作和敏感奖励环境的任务。该算法通过将策略优化集中在精英样本上,采用混合专家(MoE)策略进行模式切换,并结合学习课程的距离正则化来探索多样化策略,从而增强了优势加权回归(AWR)。
-
新的ThunderEP设计提升消费级GPU上的MoE推理性能
研究人员开发了ThunderEP,这是一种新的通信设计,用于在通过PCIe连接的消费级GPU上高效运行大型专家混合(MoE)模型。该系统解决了这些设置中固有的通信瓶颈,数据传输通常涉及CPU。ThunderEP旨在绕过CPU中继跳跃并利用DMA引擎,避免与计算资源的争用,从而减少同步延迟。在配备RTX 4090和RTX 5090 GPU的系统上进行的评估表明,与NCCL等现有方法相比,速度显著提升,MoE推理的端到端改进高达1.66倍。
-
新的 ID Balancing 方法提高了稀疏 MoE LLM 训练的稳定性
研究人员推出了一种新颖的 ID Balancing 方法,用于训练极稀疏的专家混合(MoE)大语言模型(LLM)。该技术解决了专家负载不平衡的关键问题,而这个问题会阻碍模型扩展时的训练效率和稳定性。通过将现有方法视为 PID 控制器,ID Balancing 提出了一种积分-微分控制器,它能对显著的不平衡提供更强的校正,并在接近平衡时进行更精细的调整。评估表明,ID Balancing 显著降低了不平衡指标,并保持了有竞争力的性能,使…
-
新方法使用MoE路由器实现跨语言LLM对齐
研究人员开发了一种利用混合专家(MoE)路由器在仅解码器的大型语言模型(LLM)中进行跨语言对齐的新方法。该方法通过使用MoE路由器输出来作为对齐目标,解决了因多语言分词不同而难以对齐LLM表示的挑战。在对四个开源MoE模型进行受控的持续预训练后,该方法在多样化的评估套件上展示了改进的多语言性能。
-
Hugging Face 发布 Olmo-core 3,用于可扩展的万亿参数 MoE 训练
Hugging Face 发布了 Olmo-core 3,这是一个开源框架,旨在将专家混合(MoE)大语言模型的训练扩展到万亿参数规模。该新系统通过优化专家路由和跨 GPU 分布,解决了训练大型 MoE 所面临的计算效率低下和高成本问题。基准测试表明,Olmo-core 3 显著提高了训练吞吐量,与之前的实现相比,性能最高可提高 2.7 倍,同时即使在拥有大量专家的情况下也能保持计算效率。
-
MoEless 框架通过降低延迟和成本来提高 LLM 服务效率
研究人员开发了 MoEless,一个旨在提高服务专家混合(MoE)大语言模型(LLM)效率的新颖框架。MoE 架构通常存在专家之间的负载不平衡问题,导致延迟和成本增加。MoEless 通过使用弹性专家执行和轻量级预测器来识别和管理滞后专家,优化函数局部性和 GPU 利用率来解决这个问题。实验表明,与现有解决方案相比,MoEless 可以显著降低推理延迟和成本。
-
新研究探索使用循环专家混合和专业化专家来扩展大型语言模型 · 已追踪 5 个来源
研究人员正在探索扩展大型语言模型的高级技术,重点关注专家混合(MoE)和循环结构。一篇论文介绍了 FedSEE,一种用于联邦学习的方法,通过将输入路由到客户端内的专业化专家来解决复合异质性问题,将最差服务四分位数的性能提高了高达 3.7 个点。另一项研究提出了 LOOM,一种用于循环专家混合模型的可扩展方法,可稳定递归并跨多个循环实现专家选择多样化,显示出可稳定扩展到 9-12 个循环,并显著降低困惑度。第三篇论文通过“循环缩放定律”…
-
新研究解决了视频扩散模型的效率和安全性问题
研究人员正在开发新方法来提高视频扩散模型的效率和质量。SplitMoE引入了一种分层架构,以更好地处理视频数据中的语义不平衡,在收敛速度和生成质量方面优于传统方法。PARK通过提高稀疏注意力中块检索的准确性来解决Diffusion Transformers中注意力的二次复杂度问题,从而实现更好的质量-效率权衡。DeCoPrune和Self-Aligned Forcing (SAF) 解决了自回归视频扩散中的挑战,其中DeCoPrune…
-
SlimWise 框架提升 MoE 模型服务效率
研究人员开发了 SlimWise,一个旨在提高专家混合(MoE)模型服务效率的新框架。SlimWise 将专家剪枝解耦,仅在解码阶段应用,而在预填充阶段使用完整模型。这种方法允许在解码过程中重用预填充生成的 KV 缓存,显著减少流量瓶颈。该框架还包括一个低成本的蒸馏阶段,以进一步弥合准确性差距。在 vLLM 中实现后,SlimWise 在 Qwen3.6-35B-A3B 模型上实现了高达 1.81 倍的解码吞吐量提升,同时仅进行了 5…
-
新研究通过效率和性能提升推进扩散语言模型 · 已追踪10个来源
研究人员正在开发改进扩散语言模型(DLM)的新方法,重点关注效率和性能。“Clock Diffusion”引入了具有位置相关噪声调度的半自回归连续DLM,在OpenWebText上达到了最先进的界限,并在GSM8K上超越了基线。另一种方法ITC-MoE使用重要性引导的令牌感知压缩来降低混合专家DLM的计算和存储成本,同时保持生成质量。其他进展包括分层连续扩散语言模型(HC-DLM),它将离散令牌生成与连续潜在轨迹相结合;自排斥采样(S…
-
新的MoRE架构结合了专家复用和MoE,提高了效率
研究人员推出了一种新颖的神经网络架构——混合复用专家(MoRE),它结合了循环Transformer的参数效率和混合专家(MoE)模型的能力。MoRE通过在相邻层之间共享专家池来解决传统MoE的高内存占用问题,从而在不增加参数的情况下实现更大的路由多样性。实验表明,在困惑度和下游任务方面,MoRE在各种模型规模上均优于现有的权重共享架构和标准MoE。
-
EStream 实现了移动NPU上MoE大语言模型的有效执行
研究人员开发了EStream,这是一个旨在实现混合专家(MoE)大语言模型在移动神经网络处理单元(NPU)上高效执行的新颖系统。EStream通过将固定的NPU计算与动态的MoE决策分离,允许单个编译的专家图服务于所有专家,从而解决了移动设备上MoE预填充的挑战。该系统采用专家虚拟化来管理存储在闪存中的模型参数,将其加载到NPU可寻址的区域,而不会影响性能。在骁龙智能手机上的评估表明,与现有方法相比,速度显著提升,内存占用显著减少,使…
-
使用 Ollama 在 Windows 上本地运行 AI 模型,以实现隐私和成本节约
借助 Ollama 等工具,现在许多用户可以在 Windows 上本地运行大型语言模型。这种方法提供了显著的优势,包括完整的数据隐私、零消息成本、离线功能和无限制使用。主要的硬件考虑因素是内存 (RAM) 和磁盘空间,建议使用 16GB RAM 以获得性能和功能的良好平衡,尽管 8GB 也能运行较小的模型。模型大小(以十亿参数衡量)直接关系到能力、资源需求和响应速度。
-
PCoMoE 框架通过细粒度路径组合将 MoE LLM 推理速度提升 31%
研究人员推出了一种名为 PCoMoE 的新颖框架,旨在提高专家混合(MoE)大型语言模型(LLM)的推理效率。与将整个专家视为原子单元的传统方法不同,PCoMoE 实现了细粒度的路径组合,从而能够进行更灵活、更高效的计算。该方法包含一个路径级公式、一种兼容性感知剪枝策略以消除冗余路径组合,以及一个专门的执行引擎。实验表明,PCoMoE 可将推理速度提高高达 1.31 倍,同时将模型准确率提高 10%。
-
深度学习框架革新逐向导航
研究人员开发了一个新的深度学习框架,通过生成更具上下文感知能力的语音指令来改进逐向导航系统。该系统利用Transformer和专家混合(MoE)模型,并结合云边架构以实现实时性能。实际实验表明,与传统方法相比,车辆偏离路线的情况显著减少,标志着智能交通领域的重大进步。
-
新的分层MoE模型通过影像学和电子健康记录数据增强ILD诊断
研究人员开发了一种分层专家混合(MoE)模型,用于通过整合医学影像学和电子健康记录(EHR)来诊断间质性肺病(ILD)。该模型采用两阶段门控机制:一个门对影像学和EHR预测进行加权,而一个二级模块将EHR数据专门化为临床定义的组。分层MoE实现了0.8750的优越AUC,优于仅影像学和其他方法,并提供了跨影像学、EHR利用率和特征组的增强的可解释性。
-
Ban&Pick 策略提升 MoE-LLM 性能和推理速度
研究人员开发了一种名为 Ban&Pick 的训练后策略,以提高专家混合(MoE)大语言模型的性能和效率。该方法解决了关键专家利用不足以及固定专家数量导致冗余的问题。通过识别和加强高影响力专家,Ban&Pick 提高了准确性,同时动态剪枝不太关键的专家则加快了推理速度。该策略在 DeepSeek 和 Qwen3 等模型上,在各种基准测试中都显示出显著的提升,且无需重新训练或架构更改。