Olmoe
PulseAugur coverage of Olmoe — every cluster mentioning Olmoe across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究探索专家混合模型的先进路由技术 · 跟踪 4 个来源
研究人员正在探索新的方法来提高专家混合(MoE)模型的性能和专业化。一种方法侧重于对齐不同层之间路由状态的几何结构,以揭示共享的底层动态,从而提高预测能力。另一种方法,对比路由机制(CoRM),使用针对指数移动平均的对比方法来集中路由信号,从而实现更好的专家专业化和在推理基准上的准确性提升。第三篇论文为理解 MoE 架构提供了一个统计框架,分析了近似、专家学习和路由器估计之间的权衡,并解释了共享专家如何捕获常见的预测结构。
-
新的 LLM 剪枝方法使用超越压缩分数的信息边界
研究人员开发了一种新的大型语言模型 (LLM) 剪枝方法,该方法超越了传统的压缩分数。这种方法称为“信息边界”,旨在通过分析每个统计量可以支持的区分来识别最有效的待移除参数。该方法对损害进行汇集价格建模,并使用圆锥定律来确定最佳剪枝策略,与现有参考方法相比,在最差组困惑度和端点选择方面有所改进。在 OLMoE 的实验中,使用路由器轨迹来预测单例方向,从而在特定层中实现了显著的 KL 减少。
-
新的LLM剪枝方法优先考虑最坏情况下的组性能
研究人员开发了一种新的评估和剪枝大型语言模型(LLM)的方法,该方法侧重于组鲁棒性,解决了标准压缩分数可能选择次优模型的情况。该方法将压缩统计视为信息接口,并使用锥体和纤维标识来量化不确定性。在密集LLM上的实验表明,早期保留分配将最坏组困惑度膨胀降低了高达20.9%,目标匹配选择将性能提高了高达8.0%。对OLMoE的进一步测试表明,与静态分数相比,池化端点刷新将最坏组教师KL散度降低了15.8%。
-
新的MoE路由方法超越简单不确定性优化专家使用
研究人员正在为混合专家(MoE)模型开发先进的路由机制,特别是那些使用低秩适应(LoRA)的模型。新的方法如VI-MoLE和CARE不再仅仅基于不确定性进行路由,而是专注于根据“信息价值”或“置信度自适应路由”来分配计算资源。这些方法旨在优化专家激活,以降低风险并提高准确性,尤其是在分布变化的情况下。论文还探讨了MoE路由中专家重叠和依赖性控制的潜在几何原理,表明虽然专家可能共享表示空间,但它们的协调使用对于性能至关重要。
-
新的 EPnG 框架提升了 MoE 模型微调的效率
研究人员开发了 EPnG,一种用于参数高效微调专家混合(MoE)模型的新框架。该方法通过剪枝利用率低的专家并增长高重要性的专家,在路由器门概率的指导下,自适应地重新分配微调容量。与 OLMoE 和 Qwen1.5-MoE 等 MoE 架构上的标准 LoRA 方法相比,EPnG 表现出更优越的性能,在更新显著更少比例的参数的同时,取得了与完全微调相当的结果。
-
新研究探索高效的专家混合模型
研究人员提出了几种新颖的方法来增强专家混合(MoE)语言模型的效率和能力。一种名为“专家绑定”(Expert Tying)的方法通过在Transformer层之间共享专家参数来减少内存占用,同时对性能影响最小,该方法在OLMoE、Qwen3和DeepSeek等模型上进行了评估。另一种技术“Mosaic”通过使用无数据知识蒸馏(via MoE)来训练全局模型,解决了联邦学习中的数据和模型异构性问题。此外,“解耦专家混合”(Decoupl…
-
研究:语言模型电路因架构而异
一篇新发表在arXiv上的研究调查了不同语言模型架构如何实现相似的任务功能。研究人员发现,即使在表现相似的情况下,负责任务执行的具体电路在不同的模型家族中也存在显著差异。该研究提出了一个分类法,用于对已识别电路与任务模式之间的关系进行分类,并提出混合专家(MoE)模型可能在基础的位置基底上构建任务电路。
-
新框架增强了在嘈杂模拟硬件上的 MoE LLM
研究人员推出 ROMER,一个训练后校准框架,旨在增强混合专家(MoE)大型语言模型(LLM)在模拟内存计算(CIM)系统上部署时的鲁棒性。该框架通过替换利用率不足的专家并重新校准路由器决策,以在嘈杂条件下维持负载平衡和最佳路由,从而解决 CIM 中的硬件缺陷。实验表明,ROMER 在 DeepSeek-MoE、Qwen-MoE 和 OLMoE 等模型在真实芯片噪声下时,显著降低了困惑度。
-
Apple 研究人员发布 SpecMD 以加速 MoE 模型推理
Apple 的机器学习研究团队发表了一篇论文,详细介绍了 SpecMD,这是一个用于评估专家混合(MoE)模型缓存策略的新框架。他们的实验表明,由于专家访问模式不一致,像最近最少使用(LRU)这样的传统缓存假设对 MoE 模型无效。为了解决这个问题,他们提出了一种名为“最不陈旧”(Least-Stale)的新型驱逐策略,该策略利用可预测的专家访问来显著减少缓存未命中并提高推理速度。