PulseAugur
实时 15:06:29
实体 GEMM

GEMM

PulseAugur coverage of GEMM — every cluster mentioning GEMM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 11
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_216204 ·

    新的Im2win卷积方法提高了GPU性能和内存效率

    研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。

  2. TOOL · CL_195962 ·

    手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

    一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…

  3. RESEARCH · CL_158822 ·

    InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构

    研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。

  4. TOOL · CL_147944 ·

    MiniCPM-V 4.6 多模态助手可在 2011 年 GPU 上运行

    研究人员已成功将 MiniCPM-V 4.6 多模态助手部署到一台拥有 6GB 内存的 2011 年 NVIDIA Tesla C2075 GPU 上。这包括创建一个针对旧版 Fermi 架构优化的全 GPU 推理引擎,其中包含循环层的分块增量规则重写以及将视觉组件移植到 CUDA。该研究还强调了在朴素注意力内核中处理长上下文时存在的性能瓶颈,通过使用供应商 GEMM 调用来解决这些瓶颈,从而保持平坦的性能剖面并实现高效处理。

  5. TOOL · CL_152469 ·

    ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能

    研究人员开发了 ExaGEMM 框架,旨在优化 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作。该框架解决了高效执行不适合传统 CPU 架构的低比特精度权重和激活的挑战。通过共同探索参数化内核和轻量级 SIMD 指令集支持,ExaGEMM 显著减小了最优配置的搜索空间,并为特定的 ML 模型和 CPU 目标生成定制化解决方案。该系统展示了显著的延迟改进,特别是在混合精度 LLM 工作负载方面,与纯软件方法相比,速度提升…

  6. RESEARCH · CL_147462 ·

    ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能 · 跟踪 2 个来源

    研究人员开发了 ExaGEMM,这是一个旨在优化传统 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作的框架。该框架解决了有效执行通常不适合标准 CPU 架构的超低比特精度计算的挑战。ExaGEMM 共同设计了参数化内核和轻量级 SIMD 指令集架构 (ISA) 支持,分析了寄存器可行性、计算成本和硬件开销等因素,以显著缩小搜索空间。与纯软件基线相比,该系统在机器学习模型的延迟方面实现了 13.29 倍的提升,特别突出了…

  7. TOOL · CL_145661 ·

    新论文创造“基线捕获”来描述创新障碍

    一篇新论文引入了“基线捕获”的概念,这种现象是指现有系统的输出成为评估新计算重构的实际规范。这会阻碍创新,因为它使得难以独立于原始实现来判断替代方案。该论文使用了一些简短的案例,包括音频前端和签名验证,来说明这种病态,并提出通过明确需求并使其独立于现有系统来“购买验证器”。

  8. TOOL · CL_129216 ·

    新内核通过融合 SwiGLU 激活来提高大语言模型推理速度

    研究人员开发了新的技术,通过在瓦片级别将 SwiGLU 激活函数直接融合到 GEMM 操作中,来加速大语言模型 (LLM) 的推理。这些方法使用为 NVIDIA H100 GPU 定制的 CUTLASS 内核实现,显著减少了中间张量物化的相关开销。在 Qwen 2.5 模型上的评估显示,与标准的 PyTorch 实现相比,速度提升高达 2.47 倍,实现了更高的峰值 BF16 利用率,并展示了优于 cuBLAS 等现有库的数值性能。

  9. RESEARCH · CL_112712 ·

    新书详解用于 AI 工作负载的现代 GPU 编程

    一本名为《现代 GPU 编程用于 MLSys》的新书旨在揭开机器学习系统高性能 GPU 内核开发的神秘面纱。该书源自卡内基梅隆大学的机器学习系统课程系列,提供了理解 GPU 硬件和构建优化内核的分步指南。它利用 TIRx Python DSL 进行实际示例,重点关注 NVIDIA 的 Blackwell 架构以及 GEMM 和 FlashAttention 等核心组件。

  10. TOOL · CL_86852 ·

    Apple M4 Max GPU 的张量计算路径被模拟,而非加速

    研究人员逆向工程了 Apple M4 Max GPU 上的 Metal 4.1 张量计算路径,发现 fp8 matmul2d 操作是模拟的,而非硬件加速。这意味着该操作在 GPU 的着色器核心上运行,至少以 fp32 精度累积,并且不使用专用的矩阵数据路径或 Apple Neural Engine。这些发现详细记录在一篇题为“Rigel”的论文中,通过实证表征和微基准测试实现,并开发了一个融合内核,其性能比分解路径高出 12.9%。

  11. TOOL · CL_53815 ·

    新框架通过反馈和技能进化增强 LLM 生成的 Verilog

    研究人员开发了 Verilog-Evolve,一个旨在增强大型语言模型生成 Verilog 代码的新框架。该系统通过整合来自功能仿真、Yosys 合成和时序分析的反馈循环,超越了孤立采样和功能检查。Verilog-Evolve 迭代地优化代码,根据可配置的评分将最佳候选者提升为新版本,并通过创建、改进和跳过决策的过程在会话中进化技能。

  12. TOOL · CL_51969 ·

    TileLang通过Python接口简化GPU内核编写

    一种名为TileLang的新编程语言旨在通过提供介于Triton等高级框架和CUTLASS等底层控制之间的中间层来简化GPU内核开发。TileLang允许开发人员编写Python代码,同时显式定义数据在内存层次结构和流水线阶段的放置。然后,编译器会推断线程映射并优化布局,从而降低了通常与手动线程管理相关的复杂性。

  13. RESEARCH · CL_26186 ·

    Sakana AI、NVIDIA 发布 TwELL,加速 LLM 训练和推理

    Sakana AI 和 NVIDIA 的研究人员开发了 TwELL,这是一种显著加速大型语言模型 (LLM) 操作的新方法。通过针对计算密集型的前馈层,TwELL 实现了高稀疏性,并在 GPU 上转化为实际性能提升。该方法在不影响模型准确性的情况下,训练速度最高提升 21.9%,推理速度最高提升 20.5%。

  14. RESEARCH · CL_14208 ·

    Tempus框架为边缘AI提供可扩展、资源高效的GEMM

    研究人员开发了Tempus,一个旨在优化AMD Versal SoC上边缘AI部署的通用矩阵乘法(GEMM)的新框架。与在资源受限设备上失败的现有空间扩展方法不同,Tempus使用固定的计算块和通过迭代执行及数据分块实现的时间扩展。这种方法取得了显著的性能提升,在10.677W功耗下实现了607 GOPS,同时与先前最先进的方法相比,在资源和功耗节约方面表现更优。