PulseAugur
实时 06:53:02
实体 OLMoE-1B-7B

OLMoE-1B-7B

PulseAugur coverage of OLMoE-1B-7B — every cluster mentioning OLMoE-1B-7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_221100 ·

    MoE 模型显示出脆弱的道德编码,尽管存在冗余表示

    一篇新的 arXiv 论文,题为“输出稀释:MoE 模型中冗余但脆弱的表示”,研究了道德内容在专家混合(MoE)模型中的编码。研究人员发现,尽管像 OLMoE-1B-7B 这样的 MoE 模型可以高精度地编码道德效价,但与密集模型相比,这些表示对噪声的脆弱性显著更高。这种脆弱性归因于“输出稀释”,即跨专家平均会降低信号强度,使其容易受到扰动。

  2. TOOL · CL_197991 ·

    新研究量化了专家混合模型中的量化损伤

    一篇新的研究论文探讨了量化对专家混合(MoE)模型的影响,特别关注数值扰动如何导致路由翻转。该研究提出了一种量化这种路由中介损伤的方法,并发现试点测试中约三分之一的损伤可归因于路由问题。虽然检测机制可以识别翻转何时发生,但它无法区分有益和有害的翻转,这为选择性修复带来了障碍。

  3. RESEARCH · CL_193811 ·

    新研究解耦专家混合模型的路由与聚合以提升性能

    研究人员正在探索优化稀疏专家混合(MoE)模型的新方法,超越传统手段。一项研究引入了MOSAIC框架,该框架整合了架构和系统协同设计,通过考虑硬件约束和算法选择来提高模型效率和性能。另一篇论文研究了解耦MoE路由器中专家调度(选择)和聚合(加权)的角色,提出了一种可以独立优化的后计算头,以增强语言建模目标。

  4. TOOL · CL_176538 ·

    AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM

    AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…

  5. TOOL · CL_108057 ·

    MoE模型在消费级和边缘硬件上的推理表现不一

    一项最新研究调查了混合专家(MoE)语言模型在消费级和边缘硬件上是否提供实际的推理优势。研究发现,虽然MoE模型理论上可以减少每个token的计算量,但这种优势在实践中并非总是能实现。性能因设备而异,MoE模型在笔记本电脑上表现略有劣势,在边缘设备上劣势更明显,消耗更多能量并达到内存限制。

  6. RESEARCH · CL_79500 ·

    新方法通过消融实验验证大语言模型电路

    研究人员开发了一种新方法,通过聚类注意力头共激活统计数据来发现大语言模型中的电路。这种方法被称为“闭环验证电路发现”,使用因果消融来确认这些已识别的组件组是否确实作为电路运行。该方法已在 Pythia 1B 和 OLMo 1B 等模型上进行了测试,证明了其在识别统计上显著的电路方面的有效性,同时也显示了其在混合专家模型中的局限性。

  7. TOOL · CL_68336 ·

    Regret Pre-training 提升语言模型知识接地能力

    研究人员开发了一种名为 Regret Pre-training 的新自监督学习框架,以改进因果语言模型。该方法利用了通常在标准因果训练中不可用的未来信息,通过使用双视图架构。该框架训练模型同时生成因果学生分布和未来条件教师分布,最小化它们之间的差异以传递面向未来的信号。在九个下游任务上的实验显示准确性显著提高,其中一种配置将 BoolQ 的性能提高了 18 个百分点以上。

  8. RESEARCH · CL_53472 ·

    MobileMoE模型为端侧LLM树立了新的效率标杆

    研究人员推出MobileMoE,这是一系列专为移动部署设计的新型端侧专家混合(MoE)语言模型。这些模型拥有不足十亿的激活参数,通过优化MoE架构以适应移动设备的内存和计算限制,为端侧LLM树立了新的性能标杆。与领先的密集LLM和现有的MoE模型相比,MobileMoE模型在14项基准测试中表现出竞争力或更优的性能,同时使用的FLOPs和参数显著减少。该项目还实现了智能手机上首个高效MoE推理,展示了预填充和解码时间的显著加速。

  9. TOOL · CL_25610 ·

    研究发现 MoE 模型在复杂推理任务上错误路由 token

    研究人员发现混合专家(MoE)语言模型中存在一个重大问题,即路由机制(将 token 指向特定专家)经常选择次优路径。虽然标准路由器在置信度高的 token 上表现良好,但在复杂推理任务上却无法识别出性能更好的路径。这种错误路由存在于包括 Qwen3、GPT-OSS、DeepSeek-V2 和 OLMoE 在内的几款主流 MoE 模型中。研究表明,即使对路由器进行微小的更新,而不改变专家本身,也能提高在具有挑战性的数学和推理基准测试上…