艾伦人工智能研究所 (AI2) 发布了 Olmo-core 3,这是一个专为大规模专家混合 (MoE) 模型训练设计的开放式基础设施。该新系统通过将专家常驻 GPU 来提高吞吐量,对于一个 47B 参数的模型,实现了超过 52,000 tokens/GPU/秒的吞吐量,比之前的实现提高了 2.7 倍。Olmo-core 3 还通过 MXFP8 实现了 21% 的训练吞吐量提升,同时减少了内存使用。该基础设施旨在作为未来 Olmo 模型的基础,并可供研究人员使用。 AI
影响 提高了训练大型 AI 模型效率和可访问性,可能加速 MoE 架构的研究和开发。
排序理由 著名研究机构发布用于大规模 AI 模型训练的新开源基础设施。
在 Mastodon — fosstodon.org 阅读 →
- Allen Institute for Artificial Intelligence
- ChatGPT
- Claude
- Genex
- MIT License
- Nvidia
- Olmo-core 3
- Three.js
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →