研究人员开发了一种新颖的方法,使用 4 位浮点精度 (FP4) 来训练大型语言模型 (LLM),这比标准的 bfloat16 或 FP8 有显著降低。该技术通过引入一种二维块量化方法,解决了之前在 FP4 训练中遇到的不稳定性问题,该方法即使在张量转置后也能确保前向和后向传播之间的一致缩放因子。该方法还结合了无截断缩放和随机舍入,以管理量化误差并保持无偏梯度。当应用于多达 70 亿参数的 LLM 和一个 300 亿参数的专家混合模型时,这种 FP4 训练在困惑度和下游准确性方面仅有不到 1.3% 的下降,达到了与 bfloat16 相当的性能。 AI
影响 通过降低低精度的计算和内存需求,实现更高效的 LLM 训练。
排序理由 详细介绍 LLM 训练新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →