研究人员开发了两种不同的方法来提高 Transformer 模型在训练和部署方面的效率和理解能力。一种名为 ExFusion 的方法提出了一种预训练技术,该技术在训练过程中将 Transformer 前馈网络中的多个专家融合为一个统一的专家,从而降低了计算成本和部署开销。另一个项目 H64LM 是一个从头开始用 PyTorch 构建的 2.49 亿参数的专家混合(MoE)Transformer,旨在通过手动实现注意力机制和 MoE 路由等核心组件来帮助研究人员理解现代大型语言模型。 AI
影响 这些进展为更有效地训练和更深入地理解 Transformer 和 MoE 等复杂 AI 架构提供了新的途径。
排序理由 两个独立的研究项目,详细介绍了改进 Transformer 模型和专家混合(MoE)架构的方法。
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- ExFusion
- Gotit.pub
- Hugging Face
- Mixture of Experts (MoE)
- ScienceCast
- Suncheng Xiang
- Transformer
- H64LM
- Haiderkhan64
- PyTorch
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →