研究人员推出了一种新颖的 Transformer 训练架构 Mobius Learning,该架构利用了循环深度折叠。此方法允许不同的数据流遵循循环移位的块顺序,从而使同一块组能够针对浅层和深层角色进行优化。在 FineWeb 标记上使用修改后的 GPT-2 small 模型进行的实验表明,Mobius Learning 与标准的循环 Transformer 相比,验证损失更低,这表明块不必局限于固定的位置角色。这种方法对于内存受限的分布式训练尤其有利,因为它将原始数据保留在本地,并将块组分布在各个工作节点上。 AI
影响 引入了一种新颖的训练方法,可以提高 Transformer 模型在内存受限环境中的效率和性能。
排序理由 该集群包含一篇详细介绍 Transformer 新训练架构的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →