PulseAugur
中
实时 06:26:19
实体 mixture of experts

mixture of experts

PulseAugur coverage of mixture of experts — every cluster mentioning mixture of experts across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
397
90 天内 397
发布 · 30天
0
90 天内 0
论文 · 30天
313
90 天内 313
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-11 research_milestone A new paper proposes an enhanced Mixture-of-Experts framework for faster time series forecasting model training. 来源
情绪 · 30 天

21 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_284763 ·

    自适应MoE Swin Transformer增强无线图像传输

    研究人员开发了一种新颖的自适应语义通信系统,用于无线图像传输,该系统在Swin Transformer架构中利用了混合专家(MoE)机制。该系统通过同时考虑图像内容和实时信道条件,将图像数据动态路由到专门的专家,克服了先前单一驱动路由方法的局限性。仿真结果表明,与现有方法相比,图像重建质量和传输效率得到了显著提高。

  2. TOOL · CL_284642 ·

    新的MASKerade方法将密集AI模型升级为稀疏MoE专家

    研究人员开发了MASKerade,一种将密集AI模型转换为稀疏混合专家(MoE)模型的新颖方法。该技术涉及将专家学习为冻结的前馈网络的子网络,并由学习到的二元掩码和令牌级路由器指导。这种方法允许灵活的专家结构,并在使用Qwen和Gemma骨干网络时,在视觉-语言基准测试上取得了卓越的性能,优于现有的密集到MoE升级方法。

  3. TOOL · CL_284565 ·

    小型语言模型展示出有限的可迁移抽象推理能力

    一项发表在arXiv上的新研究调查了小型语言模型的抽象推理能力,特别考察了decoder-only、encoder-decoder和mixture-of-experts架构。研究利用ARC-TGI基准来分析这些模型如何习得可迁移规则,而非拟合训练数据的特异性。研究结果表明,虽然可以实现相当大的in-distribution准确率,但模型的性能高度依赖于优化、训练数据广度和评估分布,在训练集之外通常会急剧下降。

  4. TOOL · CL_284502 ·

    新框架改进了移动设备上MoE LLM的联邦学习

    研究人员开发了FedAlign-MoE,一个旨在改进移动边缘设备上混合专家(MoE)大语言模型的联邦学习框架。该方法解决了跨设备数据异构性带来的挑战,这种异构性可能导致门控偏好分歧和专家语义模糊。FedAlign-MoE通过加权和正则化确保路由一致性,同时对齐专家语义以保持专业化,并在非独立同分布(non-IID)环境中提高整体准确性和收敛速度。

  5. TOOL · CL_284377 ·

    RelayMoE 提升 MoE 训练效率和内存使用率

    研究人员开发了 RelayMoE,这是一种新颖的基于环的执行模型,旨在提高混合专家(MoE)模型分布式训练期间的内存效率。该方法通过循环专家权重或令牌并在本地计算,避免了构建完整的 top-k 扩展调度缓冲区。RelayMoE 还可以实现内存高效的反向传播重计算,从而支持更长的序列和更大的批次,或者保留更多的注意力激活以提高训练吞吐量。在 30B-57B 参数 MoE 模型上的评估表明,与 Megatron-LM 相比,速度提高了 2…

  6. TOOL · CL_284002 ·

    180B AI 模型通过 MoE 和 SSD 流式传输在游戏本上运行

    VIDRAFT 发布了 POCKET-Darwin-180B,这是一款拥有 1800 亿参数的 AI 模型,专为包括游戏本在内的消费级硬件部署而设计。该模型利用稀疏专家混合(MoE)架构、SSD 流式传输和 llama.cpp 运行时,使其能够以显著降低的内存需求运行。该模型的主要用例是在无法使用基于云的 AI 解决方案的隔离网络或受监管环境中。

  7. TOOL · CL_283709 ·

    MoE模型的稀疏激活影响4位量化质量

    混合专家(MoE)模型尽管参数量巨大,但对于任何给定的token,仅使用其中一小部分参数。这种稀疏性意味着4位量化对MoE模型的影响与对密集模型不同。虽然MoE模型可以容忍对其较少使用的“专家”参数进行更激进的量化,但像路由器和始终激活的张量等关键组件需要更高的精度来维持准确性。混合精度量化技术,例如Unsloth的UD-Q4_K_XL,通过对“冷路径”参数应用较低精度,同时将“热路径”参数保持在较高精度,从而保留准确性,这种方法可以…

  8. RESEARCH · CL_283689 ·

    AI模型通过自动化验证循环进行自我改进 · 跟踪6个来源

    一种新的AI模型改进方法,称为递归自我改进(RSI),侧重于增强模型的核心能力,而不仅仅是其周围框架。该方法涉及AI生成自己的问题解决方案,在没有人为干预的情况下自动验证这些解决方案的正确性,然后对经过验证的集合进行再训练。此过程旨在改进模型。

  9. RESEARCH · CL_284559 ·

    TRACE框架为混合专家语言模型的FP4量化提供更快速度

    研究人员开发了TRACE,一种用于混合专家(MoE)语言模型使用FP4精度进行量化感知训练的新型框架。该方法通过使用滚动(rollout)侧的量化结果来指导训练侧的舍入决策,直接减小了训练和滚动路径之间的差异。TRACE还采用了一种高效的量化信息缓存方案,减少了存储和通信开销。评估表明,TRACE在滚动生成方面实现了高达5.4倍的速度提升,性能与BF16滚动相当。

  10. TOOL · CL_281947 ·

    智谱AI的GLM 5.3模型现已在Amazon Bedrock上可用

    智谱AI的GLM 5.3,一个拥有7530亿参数的混合专家模型,现已在Amazon Bedrock上可用。该模型专为复杂的编码和长周期代理任务而设计,展现出新兴的网络安全能力。Amazon Bedrock为GLM 5.3提供托管API访问,具有提示缓存和跨区域推理功能,以优化企业客户的成本和延迟。

  11. TOOL · CL_280473 ·

    Mixture-of-Experts 模型在加密货币交易中表现好坏参半

    一项新的研究论文探讨了在加密货币订单执行中使用混合专家(MoE)模型,特别考察了训练稳定性和故障模式。研究发现,虽然在 Binance 的 BTC/USDT 数据上,与标准的双深度 Q-学习(DDQL)相比,MoE 架构在平均执行缺口方面没有显著改善,但它们确实有助于抑制策略崩溃。然而,研究人员认为,退火探索(annealed exploration)而非专家划分(expert partitioning)是防止这些崩溃的主要因素,这表…

  12. TOOL · CL_280372 ·

    Mixture-of-Experts Particle Transformers 在喷注分类中显示出准确性提升

    研究人员探索了在粒子变换器中使用混合专家(MoE)模型的有效性,用于喷注分类任务。他们对188类JetClass-II数据集的研究表明,在控制了token丢弃的情况下,top-1 MoE模型在计算成本相似的情况下,比密集基线模型提供了准确性提升。尽管计算需求增加,但每个token激活多个专家可以进一步提高预测性能。分析还显示,虽然专家分配可能与粒子身份和运动学相关,但这种结构化组织并未持续提高分类准确性。

  13. TOOL · CL_280142 ·

    新框架优化万亿参数MoE模型以提高效率

    研究人员开发了一个新的框架,用于优化混合专家(MoE)语言模型,该模型可以扩展到万亿参数。该框架解决了部署如此大型模型所带来的显著内存和带宽限制。通过采用硬件原生稀疏量化技术和定制分组稀疏GEMM内核,该系统在NVIDIA B200 GPU上实现了准确性、服务吞吐量和延迟降低方面的显著改进。

  14. TOOL · CL_279356 ·

    使用llama.cpp通过专家卸载在RTX 4090上运行100B+ MoE LLM

    一份技术指南详细介绍了如何在单块RTX 4090等消费级GPU上运行大型混合专家(MoE)语言模型,特别是超过1000亿参数的模型。该方法被称为“专家卸载”,利用了MoE架构,其中每个token只激活模型参数的一个子集。这使得计算密集但间歇使用的“专家”层可以卸载到系统内存中,而持续访问的组件(如注意力机制)则保留在GPU上。该指南提供了硬件建议、llama.cpp工具的构建说明以及实现此卸载技术的命令行示例,并强调系统内存带宽是性能的关键因素。

  15. TOOL · CL_278148 ·

    Strata 项目可在消费级 GPU 上运行大型本地 LLM

    Strata 项目可在包括 12GB 显存的 GPU 在内的消费级硬件上本地运行 Qwen3.8-Flash-Next 等大型语言模型。它通过将模型的负载分配到 GPU、CPU、RAM 和 SSD,并利用专家混合(Mixture of Experts)架构,仅激活每个 token 所需的组件来实现。在 RTX 3060 上的初步测试显示,生成速度约为每秒 30 个 token,缓存利用率高,使其成为本地编码任务的可行选项。

  16. TOOL · CL_277218 ·

    新的DS-MoE框架优化了混合专家模型中的专家选择

    研究人员推出了一种用于混合专家(MoE)模型中专家选择的新框架DS-MoE。该方法通过优化专家选择来解决MoE的内存和计算瓶颈,超越了简单的Top-k排名。DS-MoE分析专家间的依赖关系,以最大化协同效应并最小化冗余,采用定制的支配最小化算法进行高效的子集识别。实验表明,DS-MoE在保留关键专家组合和实现更好性能方面优于现有方法。

  17. TOOL · CL_277202 ·

    新的 MoRA 框架剪枝 MoE 模型,提高效率和性能

    研究人员开发了 MoRA,一个新颖的框架,用于剪枝混合专家(MoE)模型,以减少内存使用而不显著影响性能。MoRA 引入了可学习的路由器偏差来锐化路由概率并鼓励专家多样性,以及一个专家近似机制来进一步增强剪枝后的模型。在 Qwen3-30B-A3B、DeepSeek-V2-Lite 和 Moonlight-16B-A3B 上的实验表明,MoRA 在九个零样本基准测试中优于现有的剪枝方法。

  18. SIGNIFICANT · CL_276902 ·

    VIDRAFT 发布可在消费级笔记本电脑上运行的 180B LLM

    VIDRAFT 发布了 POCKET-Darwin-180B,这是其 1800 亿参数 Darwin-180B-RSI 模型的 4 位量化版本。该版本兼容 llama.cpp,可以通过利用稀疏专家混合路由和一种新颖的嫁接量化技术,在包括没有专用 GPU 的笔记本电脑在内的消费级硬件上运行。该模型的尺寸已从 360 GB 减至 111 GB,与传统的企业级 GPU 设置相比,能够以显著更低的硬件成本和系统 RAM 要求进行本地推理,同时…

  19. TOOL · CL_275474 ·

    新方法识别MoE模型中的领域专家以实现高效适应

    研究人员开发了ExpertLens,一种用于识别多模态混合专家(MoE)模型中领域专业化专家的新颖方法。该技术利用了由于稀疏计算而在MoE架构中出现的固有语义专业化。ExpertLens通过选择性地仅微调相关专家来实现高效的多模态适应,在更新更少参数和显著减少训练时间的情况下,实现了与完全微调相当的性能。

  20. TOOL · CL_275156 ·

    新的MOMAT框架增强了边缘LLM的安全性和效率

    研究人员开发了MOMAT,一个新颖的硬件增强框架,旨在提高部署在低功耗边缘设备上的量化大语言模型(qLLM)的安全性。该系统采用多图混合(Mixture of Multiple Atlases)方法,结合结构化知识检索和专用加速器来防御越狱攻击。与传统的基于DRAM的方法相比,MOMAT显著加快了提示处理速度,并大幅降低了能耗,使得边缘LLM既更安全又更节能。