研究人员开发了用于大语言模型(LLMs)中超越函数的新多项式近似方法,以提高计算效率。这些近似方法在NVIDIA Blackwell GPU上进行了测试,在孤立的内核操作中显示出从1.19倍到2.19倍的显著加速。当集成到LLM训练任务中时,这些替换方法在整体训练吞吐量方面带来了明显的改进,某些任务的增益高达8.0%。该研究还评估了这些近似方法对模型行为的影响,发现与原生实现相比,最终训练损失的差异很小。 AI
影响 通过在专用硬件上优化数学运算,有可能加速LLM的训练和推理。
排序理由 详细介绍优化LLM性能新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- bfloat16 (BF16)
- FlashAttention-4
- GB200
- Hugging Face
- tanh
- IEEE binary16 (FP16)
- large language models (LLMs)
- NVIDIA
- Nvidia Blackwell B200
- PyTorch
- sigmoid linear unit (SiLU)
- Swish-gated linear unit (SwiGLU)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →