研究人员开发了一种名为 Direct-P 的新方法,用于优化 FlashAttention-4 在 Blackwell 的 4 位浮点 (FP4) 张量核心上的性能,解决了由 softmax 转换和片上依赖引起的性能瓶颈。对于非因果推理,Direct-P 将分数直接映射到 FP4 概率,在 NVIDIA GB200 硬件上实现了高达 bfloat16 2.13 倍的吞吐量。因果训练路径通过 FP8 梯度操作数重建概率,将 80 亿参数的更新速度提高了高达 1.14 倍,但发现 MXFP4 训练轨迹会发散。 AI
影响 这项研究通过优化低精度数据类型的硬件利用率,可能带来更高效的 AI 模型训练和推理。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一种优化 AI 硬件性能的新方法。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →