PulseAugur
实时 03:09:15
实体 mixture of experts

mixture of experts

PulseAugur coverage of mixture of experts — every cluster mentioning mixture of experts across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
91
90 天内 323
发布 · 30天
0
90 天内 0
论文 · 30天
68
90 天内 251
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-11 research_milestone A new paper proposes an enhanced Mixture-of-Experts framework for faster time series forecasting model training. 来源
情绪 · 30 天

24 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_212048 ·

    面向高效帕累托集近似的混合专家模型融合

    研究人员开发了一种新颖的方法,利用基于混合专家(MoE)的模型融合来高效地近似大型深度神经网络的帕累托前沿。该方法解决了多目标优化现有算法的计算成本和可扩展性限制。通过集成专门的单任务模型,MoE模块有效地捕捉了目标权衡,并以最少的额外参数近似帕累托集,为复杂任务提供了可扩展的解决方案。

  2. TOOL · CL_212033 ·

    面向大型MoE模型的计算高效超参数迁移

    研究人员开发了一个计算高效的框架,用于确定大型混合专家(MoE)模型中的最优学习率。这个两步过程包括在不同宽度的模型之间迁移最优学习率,然后推断到海量token预算。通过在小型代理模型上进行线性回归,该方法可以准确预测长达10万亿token的训练视野的理想学习率,显著降低了计算成本。该框架成功应用于预训练一个1550亿参数的基础模型,验证了其有效性。

  3. TOOL · CL_208427 ·

    新的MoFE框架使用混合专家和FNO进行加密货币预测

    研究人员推出了一种新颖的深度学习框架MoFE,用于加密货币预测。该框架将傅里叶神经网络算子(FNOs)集成到混合专家(MoE)架构中,旨在捕捉非平稳加密货币市场的复杂动态。MoFE利用自适应FNO和卷积双域专家来学习频谱趋势和微观结构,并通过动态门控机制在不同市场状态之间进行自适应策略切换。在2020年1月至2025年12月的比特币数据上进行的实验表明,MoFE在T+1和T+5预测范围内均取得了最先进的性能,显著提高了方向准确性和信息…

  4. RESEARCH · CL_210390 ·

    新研究量化了消费级硬件上MoE模型的内存带宽限制

    一篇新的研究论文探讨了在消费级硬件上部署大型混合专家(MoE)模型的挑战,特别关注内存带宽瓶颈。该研究使用Qwen3模型量化了这种“带宽墙”,揭示解码速度受到来自SSD等较慢存储的数据传输的限制。虽然训练辅助损失可以提高可缓存性,但会以牺牲模型质量为代价,表明缺失减少和困惑度之间存在紧密的耦合关系。

  5. SIGNIFICANT · CL_207240 ·

    Moonshot AI 发布 Kimi K3 和 Kimi K2 模型,提供与 OpenAI 兼容的 API

    Moonshot AI 发布了两款旗舰模型 Kimi K3 和 Kimi K2,均基于混合专家(MoE)架构构建。Kimi K3 专为长上下文工作负载、推理和代理能力而设计,提供与 OpenAI 兼容的 API,并设有免费套餐和按量付费选项。Kimi K2 的独特之处在于其原生多模态输入,除了文本外,还能接受图像,适用于文档分析和屏幕解读等任务。开发者可以使用标准的 OpenAI SDK 集成这两个模型,从而简化采用过程。

  6. TOOL · CL_206615 ·

    CLARA框架通过剪辑级分析增强仇恨视频检测 · arXiv研究

    研究人员开发了CLARA,一个新颖的框架,旨在通过在剪辑级别分析视频来检测视频中的仇恨内容。这种方法将视频建模为细粒度剪辑的序列,以更好地捕捉短暂且隐晦的、经常出现的时域局部仇恨信号。CLARA包含一个用于多模态对齐的专家混合剪辑编码器,一个用于建模短期和长期时间依赖性的对比目标,以及用于提供语义指导的VLM派生推理。在三个数据集上的实验表明,CLARA的性能显著优于现有方法。

  7. TOOL · CL_206537 ·

    新的MoE架构提升了MLIPs的性能和可解释性

    研究人员为机器学习原子间势(MLIPs)开发了新的专家混合(MoE)和线性专家混合(MoLE)架构。这些模型集成到DPA3框架中,在OMol25、OMat24和OC20M等基准测试中,与现有基线相比,性能有了显著提升。研究强调,共享专家和逐元素路由策略的稀疏激活是增强模型容量和实现化学上可解释的专家专业化的关键。

  8. TOOL · CL_206522 ·

    CodeQuant 方法通过统一的聚类和量化增强低精度 MoE 模型

    研究人员开发了一种名为 CodeQuant 的新方法,用于提高低精度大模型的准确性,特别是那些使用混合专家(MoE)架构的模型。该方法统一了聚类和量化,以平滑激活离群值并将权重离群值吸收到聚类中心,从而减少量化误差。CodeQuant 还采用了专为 GPU 和 CPU 设计的专用内核,与现有量化技术相比,实现了显著的速度提升和更高的准确性。

  9. TOOL · CL_206282 ·

    MoE语言模型在双语训练中展现语言专业化

    研究人员探讨了专家混合(MoE)语言模型如何为双语数据开发专业化路由。他们使用声明式-过程式框架,分析了一个在顺序语言暴露下训练的英语-德语MoE Transformer。研究发现,虽然经过课程训练的模型表现出一定的语言专业化,但在混合数据上训练的基线模型表现出更强的总体专业化,尽管这种专业化依赖于种子且集中在单一语言上。然而,课程方法产生了更稳定、语言平衡的路由配置文件。

  10. TOOL · CL_206229 ·

    新的DMT-ME方法提高了数据嵌入的准确性和可解释性

    研究人员推出了一种新颖的降维方法——MoE增强可解释深度流形变换(DMT-ME),旨在克服准确性和可解释性之间的传统权衡。通过将几何感知双曲映射器与专家混合(MoE)模型集成,DMT-ME利用稀疏专家专业化来实现表示增益,并利用双曲细化来处理复杂数据结构。该方法通过基于MoE的稀疏路由和结构感知匹配来提高准确性,同时通过MoE架构明确连接输入数据、嵌入结果和关键特征来提高透明度。实验表明,DMT-ME在降维准确性和模型可解释性方面均优于现有方法。

  11. TOOL · CL_206184 ·

    Palmyra x6 LLM 首次亮相,具备代理能力和强劲的基准性能

    一份新的技术报告详细介绍了 Palmyra x6,这是一个专为代理任务设计的大型语言模型。该模型使用锚定监督微调(Anchored Supervised Fine-Tuning)在精心策划的合成工具使用轨迹集上开发,并采用了混合优化方法。在 Writer Agent 方面,Palmyra x6 相较于之前的模型有了显著改进,并在 BFCL Core 等基准测试中取得了最高分,性能优于几款近期模型。

  12. TOOL · CL_206128 ·

    新研究质疑路由分歧是MoE行为影响的证明

    一篇新论文探讨了混合专家(MoE)模型中路由分歧的现象,即不同的前向传播尽管权重相同,但可能使用不同的专家。研究人员发现,这种路由分歧仅占整体输出变异的一小部分,其中“内容”项比“路由”项更具影响力。研究表明,仅凭路由移动不足以证明行为影响,并建议在决策过程至关重要时,首先测量暴露度。

  13. TOOL · CL_205970 ·

    新的 THESIS-MoE 方法选择性地引导专家混合模型中的谄媚行为

    研究人员开发了 THESIS-MoE,一种用于训练专家混合(MoE)模型以减少谄媚行为的新颖方法。谄媚是指 AI 同意用户陈述的信念的倾向。与之前统一应用干预措施的方法不同,THESIS-MoE 使用共享的对比信号来识别和针对 MoE 层级内的谄媚行为。这种方法可以在保留模型通用知识和推理能力的同时,选择性地引导谄媚行为,在评估中将由信念引起的谄媚行为减少高达 90%。

  14. TOOL · CL_205925 ·

    新的S2-MoE框架提升了边缘设备上MoE模型的效率

    研究人员开发了S2-MoE,一个旨在提高混合专家(MoE)模型在边缘设备上推理效率的新型框架。该方法通过减少验证开销和提高专家复用性,解决了内存和带宽限制的挑战。与标准的自回归解码相比,S2-MoE可实现显著的加速,报告的增益高达5.3倍。

  15. RESEARCH · CL_208645 ·

    MoE-ViE: 用于高效图像和视频理解的混合专家视觉编码器

    研究人员开发了 MoE-ViE,一种用于高效图像和视频理解的混合专家(Mixture of Experts)视觉编码器。该架构探索了细粒度拓扑和无辅助损失的平衡,其性能持续优于密集视觉编码器。最大的 MoE-ViE 模型实现了与比其大 1.7 倍的 SOTA 编码器相当的性能,同时延迟显著降低。与大型语言模型集成后,MoE-ViE 在图像和视频基准测试上的表现均优于具有显著更多激活参数的编码器。

  16. TOOL · CL_204042 ·

    MedMix框架增强了多模态医疗AI的联邦学习能力

    研究人员开发了MedMix,一个旨在改进医疗领域多模态AI联邦学习的新框架。该方法解决了模态异构性的挑战,即不同客户端可能拥有不同程度的模态数据访问权限或数据子集。MedMix采用模态感知路由和共识引导对齐,即使在数据不完整或多样的情况下,也能确保客户端之间专家专业化的一致性。在真实医疗数据集上的实验表明,MedMix在严重数据异构条件下能取得优于平均F1分数。

  17. TOOL · CL_203899 ·

    FreeBalance框架通过工作负载预测优化MoE模型推理

    研究人员开发了FreeBalance,一个旨在提高分布式推理过程中专家混合(MoE)模型效率的新颖框架。该系统解决了负载不平衡问题,即负载过重的节点会拖慢全局执行并增加延迟。FreeBalance通过预测残余工作负载并将专家迁移与前置计算阶段重叠来实现这一点,从而有效地隐藏了平衡开销。实验证明,负载不平衡和端到端预填充延迟得到了显著降低。

  18. TOOL · CL_203866 ·

    深度感知分析揭示Qwen MoE模型层的敏感性

    研究人员开发了一种用于混合专家(MoE)模型的深度感知敏感性分析方法,并将其应用于Qwen3.6-35B-A3B模型。他们的研究结果表明,早期和中期层对专家掩码高度敏感,而后期层可以容忍显著的掩码而不会导致性能大幅下降。这项研究为通过专家掩码进行模型压缩提供了一种实用的方法,有望实现更高效的LLM。

  19. TOOL · CL_208191 ·

    FreeToken 系统使大型 MoE 模型能在个人设备上运行

    一个名为 FreeToken 的新服务系统已被开发出来,以支持大型专家混合(MoE)模型在个人设备上的高效运行。该系统动态适应异构本地硬件,优化计算和模型状态,以持续映射到可用资源。FreeToken 支持广泛的 MoE 模型和代理工作负载,允许在消费级硬件上部署明显更大的模型,例如在单个工作站 GPU 上运行 753B 模型。

  20. TOOL · CL_203388 ·

    Kimi K3 的 2.8T 参数凸显了大型语言模型部署作为一项系统工程挑战

    Kimi K3 模型拥有 2.8 万亿总参数,每个 token 约有 1040 亿活跃参数,其部署挑战远超其庞大的规模。其架构融合了混合专家(mixture-of-experts)设计和原生多模态支持,上下文窗口超过一百万个 token。至关重要的是,该模型使用低精度 MXFP4 权重和 MXFP8 激活进行训练,这意味着量化是其推理路径的内在组成部分,而非事后考虑。这需要能够高效执行这些原生格式的专用硬件,目前的 vLLM 指导建议…