PulseAugur
实时 12:36:20
English(EN) MoonMath AI has open-sourced a HIP attention kernel for AMD MI300X that beats AMD's own AITER v3 on every shape and rounding mode. The bf16 forward attention ke

MoonMath AI 开源 AMD MI300X 注意力内核,性能优于 AITER v3 · 跟踪 3 个来源

MoonMath AI 发布了一个开源的 HIP 注意力内核,适用于 AMD 的 MI300X GPU,据报道其性能优于 AMD 自家的 AITER v3。该内核通过优化内存布局和使用单指令汇编包装器进行寄存器控制,实现了高达 1.26 倍的速度提升。此优化已集成到 SGLang 中,以加速 Wan2.1 等视频扩散模型。 AI

影响 优化的 GPU 内核可以加速 AI 模型的训练和推理,可能导致更快的开发周期和更高效的 AI 应用部署。

排序理由 该集群描述了一个用于 AI 计算的专用 GPU 内核的开源,这是一个研究和开发产物,而不是一个完整的模型发布或产品发布。

在 Mastodon — sigmoid.social 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

MoonMath AI 开源 AMD MI300X 注意力内核,性能优于 AITER v3 · 跟踪 3 个来源

报道来源 [3]

  1. Mastodon — sigmoid.social TIER_1 English(EN) · [email protected] ·

    MoonMath AI 已开源 HIP 注意力内核,适用于 AMD MI300X,在所有形状和舍入模式下均优于 AMD 自家的 AITER v3。bf16 前向注意力内核

    MoonMath AI has open-sourced a HIP attention kernel for AMD MI300X that beats AMD's own AITER v3 on every shape and rounding mode. The bf16 forward attention kernel uses one-instruction asm wrappers and achieves up to 1.26x speedup. # AIagent # AI # GenAI # AIInfrastructure https…

  2. Mastodon — fosstodon.org TIER_1 English(EN) · [email protected] ·

    MoonMath AI 已开源 HIP 注意力内核,适用于 AMD MI300X GPU,在所有形状上均优于 AMD 自家的 AITER v3,速度提升高达 1.26 倍。该技巧使用了

    MoonMath AI has open-sourced a HIP attention kernel for AMD's MI300X GPU that beats AMD's own AITER v3 on every shape, with speedups up to 1.26x. The trick uses one-instruction asm wrappers for register control. K stays in LDS, V in L1, Q in registers. https://www. marktechpost.c…

  3. r/StableDiffusion TIER_2 English(EN) · /u/woct0rdho ·

    EvoTensile: 进化算法用于 AMD Tensile GEMM 核调优

    <!-- SC_OFF --><div class="md"><p>There has been an effort to tune kernels in hipBLASLt so the most basic matmuls can run faster. It's known that on Strix Halo (gfx1151), GEMM with NN and TN input layouts (used in inference) are already well-tuned, while NT and TT layouts (used i…