PulseAugur
中
实时 17:56:23
实体 GEMM

GEMM

PulseAugur coverage of GEMM — every cluster mentioning GEMM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
20
90 天内 20
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 20 条
  1. TOOL · CL_284666 ·

    新的 SSR 方法加速三元 LLM 推理

    研究人员开发了稀疏分段归约(SSR)方法,这是一种加速三元大型语言模型(LLM)推理的新方法。该方法优化了三元权重(使用三元值压缩且通常具有高稀疏性)的矩阵乘法。SSR 引入了专用的三元数据格式和利用计算树稀疏性模式的算法,与 RSR++ 等现有方法相比,在理论和实践上都实现了加速。

  2. TOOL · CL_284363 ·

    新的 T-CCL 库利用 TMA 提升多 GPU AI 模型性能

    研究人员开发了 T-CCL,这是一个专为大型 Transformer 模型中高效多 GPU 执行而设计的新型集体通信库。T-CCL 利用张量内存加速器 (TMA) 来卸载数据移动和归约操作,显著减少了 GPU 流式多处理器 (SM) 上所需的计算资源。这种减少使得通信和计算能够更好地并发执行,从而提高性能。评估显示,在资源受限的条件下,T-CCL 的性能比 NCCL 等现有库高出 3.42 倍,并提高了 vLLM 等系统中的端到端推理吞吐量。

  3. TOOL · CL_273379 ·

    空间填充曲线简化了通信规避矩阵乘法

    一篇新的研究论文介绍了空间填充曲线(SFC)作为一种方法,用于简化和优化高性能计算和深度学习的通信规避通用矩阵乘法(CA-GEMM)。该方法实现了平台无关和形状无关的矩阵乘法方案,并提高了数据局部性。SFC-CA GEMM算法展示了可证明的渐近通信最优性,并在x86和Arm平台上比供应商库的性能高出5.5倍。其在LLM推理预填充中的应用显示速度提升高达1.85倍,在分布式内存矩阵乘法中,速度提升高达2.3倍。

  4. RESEARCH · CL_251989 ·

    新工具和研究致力于 GPU AI 工作负载的优化

    多篇研究论文和一个新的开源工具解决了在 GPU 上优化 AI 工作负载的挑战。COMPASS-ABS 旨在减少深度学习训练共享 GPU 集群中的碎片化,提高资源利用率和作业完成时间。研究人员还开发了自适应框架,如用于商品 GPU 上高效长上下文推理的 Tri-Metric Router 和使用数据流不变性进行代理 GPU 优化的 Ave。此外,mKernel 和 AttnFuse 分别专注于为多 GPU 系统和注意力机制创建快速、融合…

  5. COMMENTARY · CL_250521 ·

    AI对齐倡导者呼吁监管GEMM和GEMV操作

    有人呼吁监管GEMM和GEMV操作,这对于AI对齐和模型执行至关重要。该提议建议,未经适当许可而使用BLAS(基本线性代数子程序)的实体,特别是在本地部署模型时,应接受监管审查。这项举措将这些数学运算的使用置于AI安全和对齐的背景下。

  6. TOOL · CL_247090 ·

    Together AI 为 NVIDIA Vera Rubin Blackwell GPU 优化 ThunderKittens

    Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅…

  7. TOOL · CL_216204 ·

    新的Im2win卷积方法提高了GPU性能和内存效率

    研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。

  8. TOOL · CL_195962 ·

    手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

    一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…

  9. RESEARCH · CL_158822 ·

    InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构

    研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。

  10. TOOL · CL_147944 ·

    MiniCPM-V 4.6 多模态助手可在 2011 年 GPU 上运行

    研究人员已成功将 MiniCPM-V 4.6 多模态助手部署到一台拥有 6GB 内存的 2011 年 NVIDIA Tesla C2075 GPU 上。这包括创建一个针对旧版 Fermi 架构优化的全 GPU 推理引擎,其中包含循环层的分块增量规则重写以及将视觉组件移植到 CUDA。该研究还强调了在朴素注意力内核中处理长上下文时存在的性能瓶颈,通过使用供应商 GEMM 调用来解决这些瓶颈,从而保持平坦的性能剖面并实现高效处理。

  11. TOOL · CL_152469 ·

    ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能

    研究人员开发了 ExaGEMM 框架,旨在优化 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作。该框架解决了高效执行不适合传统 CPU 架构的低比特精度权重和激活的挑战。通过共同探索参数化内核和轻量级 SIMD 指令集支持,ExaGEMM 显著减小了最优配置的搜索空间,并为特定的 ML 模型和 CPU 目标生成定制化解决方案。该系统展示了显著的延迟改进,特别是在混合精度 LLM 工作负载方面,与纯软件方法相比,速度提升…

  12. RESEARCH · CL_147462 ·

    ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能 · 跟踪 2 个来源

    研究人员开发了 ExaGEMM,这是一个旨在优化传统 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作的框架。该框架解决了有效执行通常不适合标准 CPU 架构的超低比特精度计算的挑战。ExaGEMM 共同设计了参数化内核和轻量级 SIMD 指令集架构 (ISA) 支持,分析了寄存器可行性、计算成本和硬件开销等因素,以显著缩小搜索空间。与纯软件基线相比,该系统在机器学习模型的延迟方面实现了 13.29 倍的提升,特别突出了…

  13. TOOL · CL_145661 ·

    新论文创造“基线捕获”来描述创新障碍

    一篇新论文引入了“基线捕获”的概念,这种现象是指现有系统的输出成为评估新计算重构的实际规范。这会阻碍创新,因为它使得难以独立于原始实现来判断替代方案。该论文使用了一些简短的案例,包括音频前端和签名验证,来说明这种病态,并提出通过明确需求并使其独立于现有系统来“购买验证器”。

  14. TOOL · CL_129216 ·

    新内核通过融合 SwiGLU 激活来提高大语言模型推理速度

    研究人员开发了新的技术,通过在瓦片级别将 SwiGLU 激活函数直接融合到 GEMM 操作中,来加速大语言模型 (LLM) 的推理。这些方法使用为 NVIDIA H100 GPU 定制的 CUTLASS 内核实现,显著减少了中间张量物化的相关开销。在 Qwen 2.5 模型上的评估显示,与标准的 PyTorch 实现相比,速度提升高达 2.47 倍,实现了更高的峰值 BF16 利用率,并展示了优于 cuBLAS 等现有库的数值性能。

  15. RESEARCH · CL_112712 ·

    新书详解用于 AI 工作负载的现代 GPU 编程

    一本名为《现代 GPU 编程用于 MLSys》的新书旨在揭开机器学习系统高性能 GPU 内核开发的神秘面纱。该书源自卡内基梅隆大学的机器学习系统课程系列,提供了理解 GPU 硬件和构建优化内核的分步指南。它利用 TIRx Python DSL 进行实际示例,重点关注 NVIDIA 的 Blackwell 架构以及 GEMM 和 FlashAttention 等核心组件。

  16. TOOL · CL_86852 ·

    Apple M4 Max GPU 的张量计算路径被模拟,而非加速

    研究人员逆向工程了 Apple M4 Max GPU 上的 Metal 4.1 张量计算路径,发现 fp8 matmul2d 操作是模拟的,而非硬件加速。这意味着该操作在 GPU 的着色器核心上运行,至少以 fp32 精度累积,并且不使用专用的矩阵数据路径或 Apple Neural Engine。这些发现详细记录在一篇题为“Rigel”的论文中,通过实证表征和微基准测试实现,并开发了一个融合内核,其性能比分解路径高出 12.9%。

  17. TOOL · CL_53815 ·

    新框架通过反馈和技能进化增强 LLM 生成的 Verilog

    研究人员开发了 Verilog-Evolve,一个旨在增强大型语言模型生成 Verilog 代码的新框架。该系统通过整合来自功能仿真、Yosys 合成和时序分析的反馈循环,超越了孤立采样和功能检查。Verilog-Evolve 迭代地优化代码,根据可配置的评分将最佳候选者提升为新版本,并通过创建、改进和跳过决策的过程在会话中进化技能。

  18. TOOL · CL_51969 ·

    TileLang通过Python接口简化GPU内核编写

    一种名为TileLang的新编程语言旨在通过提供介于Triton等高级框架和CUTLASS等底层控制之间的中间层来简化GPU内核开发。TileLang允许开发人员编写Python代码,同时显式定义数据在内存层次结构和流水线阶段的放置。然后,编译器会推断线程映射并优化布局,从而降低了通常与手动线程管理相关的复杂性。

  19. RESEARCH · CL_26186 ·

    Sakana AI、NVIDIA 发布 TwELL,加速 LLM 训练和推理

    Sakana AI 和 NVIDIA 的研究人员开发了 TwELL,这是一种显著加速大型语言模型 (LLM) 操作的新方法。通过针对计算密集型的前馈层,TwELL 实现了高稀疏性,并在 GPU 上转化为实际性能提升。该方法在不影响模型准确性的情况下,训练速度最高提升 21.9%,推理速度最高提升 20.5%。

  20. RESEARCH · CL_14208 ·

    Tempus框架为边缘AI提供可扩展、资源高效的GEMM

    研究人员开发了Tempus,一个旨在优化AMD Versal SoC上边缘AI部署的通用矩阵乘法(GEMM)的新框架。与在资源受限设备上失败的现有空间扩展方法不同,Tempus使用固定的计算块和通过迭代执行及数据分块实现的时间扩展。这种方法取得了显著的性能提升,在10.677W功耗下实现了607 GOPS,同时与先前最先进的方法相比,在资源和功耗节约方面表现更优。