研究人员开发了一种名为“面向格式的融合”(format-aware fusion)的新技术,利用四位浮点数(FP4)精度来加速大型语言模型的预训练。该方法优化了量化生产者和消费者的交互,与标准的bfloat16和Transformer Engine方法相比,实现了显著的速度提升。在Llama-3-family 8B预训练上的评估表明,优化的FP4路径可以实现更高的tokens/s/GPU,同时保持具有竞争力的甚至有所改善的训练损失终点,这表明FP4结果与模型性能之间存在复杂的关联。 AI
影响 这项技术可以显著降低LLM预训练所需的计算成本和时间,从而可能实现更大模型的更快迭代和部署。
排序理由 详细介绍LLM预训练新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- bfloat16
- format-aware fusion
- graphics processing unit
- Hugging Face
- Llama 3
- Tensor Cores
- Transformer Engine
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →