Hugging Face 发布了 Olmo-core 3,这是一个开源框架,旨在将专家混合(MoE)大语言模型的训练扩展到万亿参数规模。该新系统通过优化专家路由和跨 GPU 分布,解决了训练大型 MoE 所面临的计算效率低下和高成本问题。基准测试表明,Olmo-core 3 显著提高了训练吞吐量,与之前的实现相比,性能最高可提高 2.7 倍,同时即使在拥有大量专家的情况下也能保持计算效率。 AI
影响 能够更有效地训练万亿参数 MoE 模型,可能降低研究人员的成本并提高其可及性。
排序理由 一家主要 AI 实验室(Hugging Face)发布了用于大型 MoE 模型的新训练基础设施框架的开源版本。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →