PulseAugur
中
实时 16:53:24
实体 transformer engine

transformer engine

PulseAugur coverage of transformer engine — every cluster mentioning transformer engine across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_277186 ·

    新的FP4融合技术加速LLM预训练,性能优于bfloat16

    研究人员开发了一种名为“面向格式的融合”(format-aware fusion)的新技术,利用四位浮点数(FP4)精度来加速大型语言模型的预训练。该方法优化了量化生产者和消费者的交互,与标准的bfloat16和Transformer Engine方法相比,实现了显著的速度提升。在Llama-3-family 8B预训练上的评估表明,优化的FP4路径可以实现更高的tokens/s/GPU,同时保持具有竞争力的甚至有所改善的训练损失终点…

  2. TOOL · CL_176520 ·

    NVIDIA Transformer Engine 教程详细介绍 GPU 加速 LLM

    NVIDIA 的 Transformer Engine 在一篇教程中得到详细介绍,该教程解释了如何加速 Transformer 工作负载。该引擎结合了融合的 GPU 内核、BF16 计算和硬件感知的 FP8 执行。教程涵盖了安装、用于 TE 内核和 FP8 张量核心的 GPU 功能检测,以及 PyTorch 回退路径。它还检查了核心融合组件,并配置了用于管理张量缩放和格式的延迟缩放 FP8 配方。