PulseAugur
实时 08:56:04

手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存合并改进以及量化操作执行更高效等因素,在大型问题规模下,INT4 性能比 FP16 快高达 98.7 倍。 AI

影响 针对低精度的优化内核可以加速特定硬件上的 AI 推理和训练。

排序理由 该集群包含一篇详细介绍 GPU 内核性能优化的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Matt J. Borowski, Blazej Osinski ·

    手写 PTX 张量核心 GEMM 内核:NVIDIA L4 多精度研究

    arXiv:2608.10103v1 Announce Type: cross Abstract: High-performance Tensor Core kernels rely on a low-level PTX pipeline built from asynchronous data movement with cp.async, warp-level matrix loads with ldmatrix, and matrix multiply-accumulate operations with mma.sync. However, mo…