PulseAugur
实时 04:30:49
实体 Olmoe

Olmoe

PulseAugur coverage of Olmoe — every cluster mentioning Olmoe across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_123049 ·

    新的 EPnG 框架提升了 MoE 模型微调的效率

    研究人员开发了 EPnG,一种用于参数高效微调专家混合(MoE)模型的新框架。该方法通过剪枝利用率低的专家并增长高重要性的专家,在路由器门概率的指导下,自适应地重新分配微调容量。与 OLMoE 和 Qwen1.5-MoE 等 MoE 架构上的标准 LoRA 方法相比,EPnG 表现出更优越的性能,在更新显著更少比例的参数的同时,取得了与完全微调相当的结果。

  2. RESEARCH · CL_90876 ·

    新研究探索高效的专家混合模型

    研究人员提出了几种新颖的方法来增强专家混合(MoE)语言模型的效率和能力。一种名为“专家绑定”(Expert Tying)的方法通过在Transformer层之间共享专家参数来减少内存占用,同时对性能影响最小,该方法在OLMoE、Qwen3和DeepSeek等模型上进行了评估。另一种技术“Mosaic”通过使用无数据知识蒸馏(via MoE)来训练全局模型,解决了联邦学习中的数据和模型异构性问题。此外,“解耦专家混合”(Decoupl…

  3. TOOL · CL_72690 ·

    研究:语言模型电路因架构而异

    一篇新发表在arXiv上的研究调查了不同语言模型架构如何实现相似的任务功能。研究人员发现,即使在表现相似的情况下,负责任务执行的具体电路在不同的模型家族中也存在显著差异。该研究提出了一个分类法,用于对已识别电路与任务模式之间的关系进行分类,并提出混合专家(MoE)模型可能在基础的位置基底上构建任务电路。

  4. TOOL · CL_29430 ·

    新框架增强了在嘈杂模拟硬件上的 MoE LLM

    研究人员推出 ROMER,一个训练后校准框架,旨在增强混合专家(MoE)大型语言模型(LLM)在模拟内存计算(CIM)系统上部署时的鲁棒性。该框架通过替换利用率不足的专家并重新校准路由器决策,以在嘈杂条件下维持负载平衡和最佳路由,从而解决 CIM 中的硬件缺陷。实验表明,ROMER 在 DeepSeek-MoE、Qwen-MoE 和 OLMoE 等模型在真实芯片噪声下时,显著降低了困惑度。

  5. TOOL · CL_20119 ·

    Apple 研究人员发布 SpecMD 以加速 MoE 模型推理

    Apple 的机器学习研究团队发表了一篇论文,详细介绍了 SpecMD,这是一个用于评估专家混合(MoE)模型缓存策略的新框架。他们的实验表明,由于专家访问模式不一致,像最近最少使用(LRU)这样的传统缓存假设对 MoE 模型无效。为了解决这个问题,他们提出了一种名为“最不陈旧”(Least-Stale)的新型驱逐策略,该策略利用可预测的专家访问来显著减少缓存未命中并提高推理速度。