PulseAugur
实时 15:22:34
English(EN) ExFusion: Efficient Transformer Training via Multi-Experts Fusion

新方法旨在提高 Transformer 的效率和理解能力

研究人员开发了两种不同的方法来提高 Transformer 模型在训练和部署方面的效率和理解能力。一种名为 ExFusion 的方法提出了一种预训练技术,该技术在训练过程中将 Transformer 前馈网络中的多个专家融合为一个统一的专家,从而降低了计算成本和部署开销。另一个项目 H64LM 是一个从头开始用 PyTorch 构建的 2.49 亿参数的专家混合(MoE)Transformer,旨在通过手动实现注意力机制和 MoE 路由等核心组件来帮助研究人员理解现代大型语言模型。 AI

影响 这些进展为更有效地训练和更深入地理解 Transformer 和 MoE 等复杂 AI 架构提供了新的途径。

排序理由 两个独立的研究项目,详细介绍了改进 Transformer 模型和专家混合(MoE)架构的方法。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新方法旨在提高 Transformer 的效率和理解能力

报道来源 [2]

  1. arXiv cs.CV TIER_1 English(EN) · Jiacheng Ruan, Daize Dong, Xiaoye Qu, Tong Zhu, Ting Liu, Yuzhuo Fu, Yu Cheng, Suncheng Xiang ·

    ExFusion:通过多专家融合实现高效 Transformer 训练

    arXiv:2603.27965v2 Announce Type: replace Abstract: Mixture-of-Experts (MoE) models substantially improve performance by increasing the capacity of dense architectures. However, directly training MoE models requires considerable computational resources and introduces extra overhe…

  2. r/MachineLearning TIER_1 English(EN) · /u/Loose_Literature6090 ·

    H64LM:一个249M参数的混合专家Transformer,完全用PyTorch从头构建 [P]

    <!-- SC_OFF --><div class="md"><p>Hi everyone,</p> <p>I built H64LM, a research project to better understand modern LLMs by implementing one from scratch in PyTorch.</p> <p>Instead of relying on high-level training frameworks, I implemented the core components myself attention, M…