Mixture of Experts (MoE)
PulseAugur coverage of Mixture of Experts (MoE) — every cluster mentioning Mixture of Experts (MoE) across labs, papers, and developer communities, ranked by signal.
10 天有情绪数据
MoE research is increasingly focusing on dynamic expert selection and adaptation
Multiple recent papers introduce frameworks like ZEDA, Dynamic TMoE, and EMO that emphasize dynamic adjustments to the expert pool or routing mechanisms. ZEDA allows skipping experts, EMO progressively expands the pool, and Dynamic TMoE adapts experts based on distribution shifts. This trend indicates a shift from static MoE architectures towards more adaptive and efficient dynamic systems.
MoE efficiency frameworks (ZEDA, EMO) to see wider adoption in open-source models within 6 months
Recent research highlights multiple frameworks (ZEDA, EMO) focused on improving MoE efficiency through techniques like expert skipping and progressive expansion. The mention of MoE in Hugging Face's recent AI advancements suggests growing interest in the architecture. These efficiency gains are likely to be integrated into popular open-source MoE models to reduce inference costs and improve training times, making them more accessible.
Frameworks for MoE hyperparameter optimization (like Complete-muE) will become crucial for scaling MoE deployments
The introduction of Complete-muE specifically addresses the challenge of hyperparameter transfer in MoE models. As MoE architectures grow in complexity and size, efficiently tuning and transferring hyperparameters across different configurations will be essential for practical deployment and achieving optimal performance. This suggests a growing need for specialized tools to manage MoE at scale.
-
新研究量化了消费级硬件上MoE模型的内存带宽限制
一篇新的研究论文探讨了在消费级硬件上部署大型混合专家(MoE)模型的挑战,特别关注内存带宽瓶颈。该研究使用Qwen3模型量化了这种“带宽墙”,揭示解码速度受到来自SSD等较慢存储的数据传输的限制。虽然训练辅助损失可以提高可缓存性,但会以牺牲模型质量为代价,表明缺失减少和困惑度之间存在紧密的耦合关系。
-
Mamba--MoE代理模型增强逆变器瞬态预测
研究人员开发了一种新颖的Mamba代理模型,集成了专家混合(MoE)路由系统。该统一模型旨在处理逆变器瞬态的闭环仿真和测量窗口预测。通过使用具有任务条件和专家路由的单一Mamba骨干网络,Mamba--MoE代理模型在利用更少参数的情况下,实现了与单独的专业模型相当的低误差性能。自适应一致层为两种预测任务提供了可靠的预测区间。
-
MAPLE框架优化MoE LLM专家分配以提高效率
研究人员开发了MAPLE,一个新颖的框架,旨在优化混合专家(MoE)Transformer模型中专家的分配。与将专家均匀分布在所有层中的传统方法不同,MAPLE根据层级敏感性自适应地重新分配专家预算。这种即插即用方法在不改变模型权重或需要重新训练的情况下提高了性能。实验表明,MAPLE在DeepSeek-MoE-16B等模型上提高了准确性,并显著降低了服务延迟和提高了吞吐量。
-
新的DeaMoE架构提升LLM解码效率
研究人员推出了一种新颖的混合专家(MoE)架构DeaMoE,旨在提高大型语言模型(LLM)的解码效率,尤其是在小批量场景下。这种新结构将专家分组到部门中,允许部门内的参数共享,同时保留单个专家的独特参数。DeaMoE采用两阶段路由策略,以最大限度地减少冗余专家加载,从而显著提高解码速度并减少内存使用。实验表明,DeaMoE可以将加载的权重减少高达50.9%,并在NVIDIA H100 GPU上实现高达2.00倍的速度提升。
-
APEX 系统通过自适应预取提升边缘 MoE 推理效率
研究人员开发了 APEX,一个自适应专家预取系统,旨在提高混合专家(MoE)模型在边缘设备上的推理效率。MoE 模型因其高容量和选择性参数激活而适合边缘部署,但其性能常受限于专家参数的内存访问。APEX 利用轻量级预取路由器和学习到的置信度模型,主动预测和加载专家参数,将此加载过程与计算重叠。该方法在保持正确性模式下可实现超过 99% 的重叠准确率,并将每 token 延迟降低高达 26%,能耗延迟积提高高达 41%;无停顿模式则在对…
-
EasyBalance策略降低了分布式MoE推理中的GPU空闲时间
研究人员开发了EasyBalance,一种新颖的分布式专家混合(MoE)推理跨层负载均衡策略。该方法解决了MoE模型中专家使用不均导致的效率低下问题,即托管负载较轻的设备在等待负载最重的设备时处于空闲状态。与修改专家-设备映射或引入开销的先前方法不同,EasyBalance利用层间的固有冗余来平衡工作负载,而无需更改现有设置。实验表明,GPU空闲时间显著减少,在某些情况下提高了40%以上。
-
AMD推出Instella-MoE-16B-A3B,完全使用自家GPU训练
AMD发布了其Instella-MoE-16B-A3B AI模型,这是一个重要的进展,因为它完全使用AMD自家的GPU(特别是Instinct MI300X和MI325X)进行训练,不依赖Nvidia硬件或CUDA等软件。这个拥有160亿参数的模型采用了混合专家(MoE)架构,每次推理只激活28亿参数,从而实现更快的处理速度。AMD还完全开源了训练权重、代码和数据配方,允许社区进行审查和进一步开发,但模型权重根据ResearchRAI…
-
SpecDrop 引入用于专业化 AI 模型的无参数路由
研究人员推出 SpecDrop,一种新颖的、用于专家混合(MoE)模型的无参数路由方法,该方法利用类别标签进行专业化。与依赖学习型路由器的传统 MoE 方法不同,SpecDrop 使用一种固定方案,其中每个分支为其类别分配一个概率,并为其他类别分配少量泄露。该方法在 CIFAR-100 和 ImageNet-1K 等视觉任务上取得了优异的成绩,在没有路由的情况下性能优于参数匹配的基线。研究表明,训练信号的粒度和它们与目标类别的对齐是路…
-
新系统优化混合专家语言模型的部署
研究人员开发了AFD-Ledger系统,该系统旨在通过注意力-FFN分解(AFD)来优化混合专家(MoE)语言模型的部署。该系统采用分析执行模型和硬件搜索策略,解决了AFD和共置部署的高效硬件配置挑战。AFD-Ledger显著减少了所需的部署评估次数,同时仍能识别出最佳配置,这在LongCat 2.0硬件上得到了验证。
-
Cursor 发布开源 MoE 训练超级内核 Mixture-of-Kittens
Cursor Research 已开源 Mixture-of-Kittens (MoK),这是一个专为 Mixture-of-Experts (MoE) 模型设计的专用训练内核。该超级内核将 MoE 通信和计算融合为单一的确定性过程,据称与现有基线相比,吞吐量提高了 2.37 倍。MoK 针对 NVIDIA GB200 NVL72 机架等高端硬件进行了优化,适用于大规模 AI 模型开发和训练。
-
新的CARNet架构增强了下一代通信的神经网络接收器
研究人员开发了CARNet,这是一种新颖的信道自适应神经网络接收器,旨在改善下一代(NextG)通信中的信号检测。该网络采用混合专家(MoE)框架,其中多个由堆叠ResNet块构建的专家网络专门处理特定的信道条件。一种高效的路由机制,包含一个轻量级的表示学习模块,将信道估计投影到低维嵌入空间,以指导专家选择,从而增强了在各种场景下的泛化能力。链路级仿真表明,CARNet的性能优于现有方法。
-
Moonshot AI 发布 Kimi K3,一款 2.8T 参数的开源 MoE 模型
Moonshot AI 发布了 Kimi K3,这是一款拥有 2.8 万亿参数的开源专家混合(MoE)模型。该模型采用了 Kimi Delta Attention 等架构创新,提高了扩展效率,并在长时程编码和代理工作流等复杂任务上表现出色。模型权重以 MXFP4 格式在 Hugging Face 上提供,并详细介绍了如何使用 Amazon SageMaker HyperPod 和 Amazon EKS 在 AWS 上进行部署,这需要 …
-
SpecPrefetch框架改进了内存受限设备上MoE模型的推理性能
研究人员开发了SpecPrefetch,一个参数高效的框架,旨在提高稀疏专家混合(MoE)基础模型的推理速度。该方法通过在最终路由决策做出之前预测并异步传输必要的专家,从而解决了专家卸载造成的瓶颈。SpecPrefetch在不改变模型预训练路由的情况下,实现了更好的专家召回率并降低了延迟,证明了在Snapdragon 8 Elite等内存受限设备上部署MoE模型的实际优势。
-
Nota AI 发布面向 NVIDIA Blackwell 的 4 位量化 Solar Open2 250B 模型
Nota AI 发布了 Upstage 的 Solar Open2 250B 模型的 4 位量化版本,命名为 Solar Open2 250B — Nota NVFP4。新版本采用了 Nota AI 专有的量化技术,专门针对混合专家(MoE)大语言模型设计。运行此模型的一个关键要求是 NVIDIA Blackwell 架构,因为它利用了该系列中引入的 FP4 张量核心。
-
新研究探讨先进的边缘智能框架和优化
近期研究论文探讨了边缘智能的进展,重点关注将AI与边缘计算相结合。其中一篇论文介绍了聚类边缘智能(CEI),一个以智能为中心的框架,用于管理和共享分布式系统中的派生智能。另一篇论文研究了多模态边缘智能中压缩、专家混合(MoE)路由和量化之间的复杂交互,强调这些技术不能独立优化。此外,还在进行面向硬件的边缘智能系统设计研究,强调模型压缩和神经架构搜索。还提出了一个独立的框架EdgeFaaS,用于管理物联网、边缘和云的异构资源,以支持各种…
-
NVIDIA 宣传其 Blackwell 平台在人工智能基础设施中的能效比
NVIDIA 正在强调能效比作为人工智能基础设施的关键指标,尤其是在代理式人工智能和混合专家(MoE)架构兴起的背景下。该公司重点介绍了其 Blackwell NVL72 平台,据称与上一代 Hopper 相比,能效比提高了 25 倍。这种效率是通过硬件和软件的极端协同设计实现的,包括像 NVLink Switch 这样的专用组件和优化的推理软件 TensorRT-LLM,旨在在功率限制内最大化令牌吞吐量并最小化成本。
-
Thinking Machines 发布 Inkling,一款拥有 1T 参数和 1M 上下文的多模态大语言模型
Thinking Machines 发布了 Inkling,这是一款拥有约 1 万亿参数和 100 万 token 上下文窗口的大型多模态语言模型。该模型原生处理文本、图像和音频输入,并具备智能体能力。Inkling 基于具有混合注意力机制的仅解码器专家混合(Mixture-of-Experts)架构构建,并提供开放权重以供研究和微调。
-
RoME引入鲁棒低秩专家以增强对抗防御能力
研究人员开发了RoME(鲁棒低秩专家混合模型),这是一种增强机器学习模型对抗鲁棒性的新方法。RoME采用专家混合(MoE)架构,其中每个专家是对共享骨干网络的低秩更新,能够更好地专门处理威胁特定特征,同时有效捕捉共性。该系统还结合了双尺度门控和威胁引导多样化,以确保在不同对抗性扰动下进行有效的路由和专家利用。实验表明,RoME在鲁棒性和自然准确性方面均优于当前最先进的方法,甚至提高了对先前未见威胁的抵抗能力。
-
Tencent 发布 Hy3,一个开放的 295B MoE 模型,支持 256K 上下文
Tencent 发布了 Hy3,一个开源的 2950 亿参数专家混合(MoE)模型,专为复杂推理、代理工作流和长上下文任务而设计。该模型每个 token 只激活 210 亿参数,在保持效率的同时支持 256K 的上下文窗口。Hy3 在编码、STEM 和推理任务等各种基准测试中表现出色,并经过特定训练以提高工具调用中的可靠性、减少幻觉并增强多轮意图跟踪。该模型可通过兼容 OpenAI 的 API 访问,并提供 `reasoning_ef…
-
ContiStain框架通过MoE和关系保持蒸馏改进虚拟IHC染色
研究人员开发了ContiStain,一个新颖的框架,旨在提高虚拟免疫组织化学(IHC)染色模型在处理顺序采集数据时的性能。该方法利用混合专家(MoE)特征提取器创建一个域感知结构化特征空间,有助于最小化不同生物标志物域之间的干扰。此外,ContiStain采用关系保持蒸馏策略,在持续适应过程中保持跨域令牌级余弦相似度矩阵的一致性,从而减少先前学习到的生物标志物的遗忘。