Cublas
PulseAugur coverage of Cublas — every cluster mentioning Cublas across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的Im2win卷积方法提高了GPU性能和内存效率
研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。
-
LLM框架AUTO自动化GPU代码优化,超越基线
研究人员开发了AUTO,一个利用大型语言模型(LLM)进行自动化设计优化的新框架。该系统采用一个Strategist代理进行高级规划,以及多个Implementor代理进行并行执行,通过探索-利用策略迭代地改进设计。AUTO在GPU代码优化方面表现出显著的性能提升,在化学动力学方面超越实验室优化代码高达1.74倍,在矩阵乘法方面达到cuBLAS性能的94%。在KernelBench基准测试中,它还实现了比PyTorch基线高出118倍…
-
StitchCUDA框架通过多代理RL自动化端到端GPU编程
研究人员开发了StitchCUDA,一个用于端到端GPU程序生成的新型多代理框架。该系统采用专门的代理进行规划、编码和验证,以优化机器学习工作负载。通过将强化学习与性能分析相结合,StitchCUDA旨在提高GPU内核效率和主机端设置,从而在现有基线上实现显著的加速。
-
Nova 编译器通过积极优化解锁深度学习性能
研究人员开发了 Nova,这是一款端到端的即时 (JIT) 编译器,旨在通过对硬件和内存进行精细控制来优化深度学习模型的性能。Nova 通过融合操作、优化内存层次结构以及调优到寄存器级别的执行来实现这一点,从而实现积极的全局图优化。评估显示,Nova 在特定任务上可媲美或超越 cuBLAS 和 XLA,在模型吞吐量方面优于 PyTorch 和 XLA,并且至关重要的是,它减小了内存占用,从而能够在消费级 GPU 上训练更大的模型,否则…
-
LLM生成的硬件内核出现新的基准测试和优化工具
两篇新的研究论文介绍了用于大型语言模型(LLM)生成硬件加速器代码的基准测试和优化框架。第一篇论文KernelGenBench提供了一个统一的基准测试,用于评估LLM生成的Triton内核在不同算子源和硬件平台上的性能,揭示了基于代理的方法存在显著的性能差异和高令牌成本。第二篇论文提出了一个基于编译器的分层诊断系统,用于优化Ascend NPU等新兴加速器上的Triton内核,通过将运行时问题与编译器行为联系起来,实现了显著的加速。
-
InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构
研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。
-
AI系统CUDA-L2在矩阵乘法方面超越NVIDIA的cuBLAS
研究人员开发了CUDA-L2系统,该系统利用大型语言模型和强化学习自动优化矩阵乘法CUDA核函数。该系统通过探索人类优化难以企及的巨大配置空间,显著优于包括NVIDIA的cuBLAS和cuBLASLt库在内的现有基线。CUDA-L2在离线和模拟实时推理场景中均实现了显著的加速,展示了AI驱动的自动化在性能关键型计算任务中的潜力。
-
新的CTA-pipelining方法大幅降低LLM的多GPU延迟
研究人员推出了一种新颖的多GPU系统执行范式CTA-pipelining,该范式针对服务大型语言模型的延迟进行了优化。该方法利用了协同线程阵列(Cooperative Thread Array)层面的依赖关系,从而实现跨GPU的并发内核执行。在H200和B200系统上的实验表明,CTA-pipelining可以将特定操作的延迟降低高达31.8%,并且可以与张量并行(Tensor Parallelism)结合以获得进一步的性能提升。
-
新内核通过融合 SwiGLU 激活来提高大语言模型推理速度
研究人员开发了新的技术,通过在瓦片级别将 SwiGLU 激活函数直接融合到 GEMM 操作中,来加速大语言模型 (LLM) 的推理。这些方法使用为 NVIDIA H100 GPU 定制的 CUTLASS 内核实现,显著减少了中间张量物化的相关开销。在 Qwen 2.5 模型上的评估显示,与标准的 PyTorch 实现相比,速度提升高达 2.47 倍,实现了更高的峰值 BF16 利用率,并展示了优于 cuBLAS 等现有库的数值性能。
-
AutoMegaKernel 将 Llama 模型编译为单个 CUDA 核函数
研究人员开发了 AutoMegaKernel (AMK) 系统,该系统将 HuggingFace Llama 系列模型编译成单个、持久的 CUDA 核函数,以实现高效的前向传播。AMK 的静态验证器可确保调度安全,防止死锁和竞用条件。该系统支持从单一代码库支持多种 NVIDIA GPU 架构,并已展示出自我改进能力。
-
可预测数据使GPU矩阵乘法更快
研究人员发现,当输入数据“可预测”时,GPU上的矩阵乘法可以执行得更快。最初,一个名为CUTLASS的项目显示比NVIDIA的CuBLAS提高了10%的性能。然而,当在Python中进行基准测试时,这种提升消失了。进一步的调查显示,CUTLASS的分析器默认使用整数初始化的输入,这导致了观察到的加速。当将零初始化的矩阵与随机初始化的矩阵进行比较时,零初始化的矩阵产生了显著更高的Teraflops,这表明数据内容本身会影响matmul性能。
-
DeepSeek V4 通过自定义内核取代 cuBLAS 实现更快的性能
DeepSeek 开发了一个自定义内核栈 DeepGEMM 和 TileLang,其性能不仅媲美,而且超越了 NVIDIA 的 cuBLAS。此自定义实现实现了比特级确定性和批次不变性,解决了其他工作负载平衡策略(如 splitK 或 split-KV)中常见的非确定性输出问题。这项创新在于其浮点数学方法,确保了调试和训练结果的一致性。