PulseAugur
中
实时 03:37:55
实体 Cublas

Cublas

PulseAugur coverage of Cublas — every cluster mentioning Cublas across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
15
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 11
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 16 条
  1. MEME · CL_269048 ·

    用户寻求关于 Linux Mint 上 llama.cpp Cublas 错误的帮助

    一位 Reddit 用户在 Linux Mint 上使用 llama.cpp 时遇到 Cublas 错误,导致使用某些模型时崩溃。用户怀疑是 AI 模型建议的 CUDA 版本问题,并寻求关于如何正确卸载和重装 llama.cpp 和 CUDA 以解决问题的指导。他们还询问了 CUDA 对模型生成潜在的性能优势。

  2. TOOL · CL_247628 ·

    Qwen3-8B模型已扩展用于超低比特语言处理

    研究人员已成功将训练后三元化技术扩展到Qwen3-8B语言模型,旨在降低存储和内存需求。该研究进行了全面的评估,包括复现门、能力分析和直接打包执行。在三个语料库上,该8B模型达到了1.361倍的困惑度比,并在零样本任务上保持了64.6%的准确率,证明了其对激进离散化的鲁棒性。

  3. SIGNIFICANT · CL_246698 ·

    Together 利用 Nvidia Rubin GPU 的新功能优化推理 · 跟踪 4 个来源

    Together 宣布了其推理和 OSS 能力的进步,利用了 Nvidia Rubin GPU 的新功能。该公司已更新其 b200 gemms 以整合 Rubin 更宽的 MMA 步长、增加的张量和共享内存以及 B 侧收集器。这些优化带来了显著的性能提升,其 16k nvfp4 gemm 达到了 22.4 pflops,ThunderKittens 在新硬件上实现了具有竞争力的速度。

  4. TOOL · CL_247090 ·

    Together AI 为 NVIDIA Vera Rubin Blackwell GPU 优化 ThunderKittens

    Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅…

  5. TOOL · CL_216204 ·

    新的Im2win卷积方法提高了GPU性能和内存效率

    研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。

  6. TOOL · CL_200088 ·

    LLM框架AUTO自动化GPU代码优化,超越基线

    研究人员开发了AUTO,一个利用大型语言模型(LLM)进行自动化设计优化的新框架。该系统采用一个Strategist代理进行高级规划,以及多个Implementor代理进行并行执行,通过探索-利用策略迭代地改进设计。AUTO在GPU代码优化方面表现出显著的性能提升,在化学动力学方面超越实验室优化代码高达1.74倍,在矩阵乘法方面达到cuBLAS性能的94%。在KernelBench基准测试中,它还实现了比PyTorch基线高出118倍…

  7. TOOL · CL_193764 ·

    StitchCUDA框架通过多代理RL自动化端到端GPU编程

    研究人员开发了StitchCUDA,一个用于端到端GPU程序生成的新型多代理框架。该系统采用专门的代理进行规划、编码和验证,以优化机器学习工作负载。通过将强化学习与性能分析相结合,StitchCUDA旨在提高GPU内核效率和主机端设置,从而在现有基线上实现显著的加速。

  8. TOOL · CL_180713 ·

    Nova 编译器通过积极优化解锁深度学习性能

    研究人员开发了 Nova,这是一款端到端的即时 (JIT) 编译器,旨在通过对硬件和内存进行精细控制来优化深度学习模型的性能。Nova 通过融合操作、优化内存层次结构以及调优到寄存器级别的执行来实现这一点,从而实现积极的全局图优化。评估显示,Nova 在特定任务上可媲美或超越 cuBLAS 和 XLA,在模型吞吐量方面优于 PyTorch 和 XLA,并且至关重要的是,它减小了内存占用,从而能够在消费级 GPU 上训练更大的模型,否则…

  9. RESEARCH · CL_167228 ·

    LLM生成的硬件内核出现新的基准测试和优化工具

    两篇新的研究论文介绍了用于大型语言模型(LLM)生成硬件加速器代码的基准测试和优化框架。第一篇论文KernelGenBench提供了一个统一的基准测试,用于评估LLM生成的Triton内核在不同算子源和硬件平台上的性能,揭示了基于代理的方法存在显著的性能差异和高令牌成本。第二篇论文提出了一个基于编译器的分层诊断系统,用于优化Ascend NPU等新兴加速器上的Triton内核,通过将运行时问题与编译器行为联系起来,实现了显著的加速。

  10. RESEARCH · CL_158822 ·

    InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构

    研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。

  11. TOOL · CL_141496 ·

    AI系统CUDA-L2在矩阵乘法方面超越NVIDIA的cuBLAS

    研究人员开发了CUDA-L2系统,该系统利用大型语言模型和强化学习自动优化矩阵乘法CUDA核函数。该系统通过探索人类优化难以企及的巨大配置空间,显著优于包括NVIDIA的cuBLAS和cuBLASLt库在内的现有基线。CUDA-L2在离线和模拟实时推理场景中均实现了显著的加速,展示了AI驱动的自动化在性能关键型计算任务中的潜力。

  12. TOOL · CL_135401 ·

    新的CTA-pipelining方法大幅降低LLM的多GPU延迟

    研究人员推出了一种新颖的多GPU系统执行范式CTA-pipelining,该范式针对服务大型语言模型的延迟进行了优化。该方法利用了协同线程阵列(Cooperative Thread Array)层面的依赖关系,从而实现跨GPU的并发内核执行。在H200和B200系统上的实验表明,CTA-pipelining可以将特定操作的延迟降低高达31.8%,并且可以与张量并行(Tensor Parallelism)结合以获得进一步的性能提升。

  13. TOOL · CL_129216 ·

    新内核通过融合 SwiGLU 激活来提高大语言模型推理速度

    研究人员开发了新的技术,通过在瓦片级别将 SwiGLU 激活函数直接融合到 GEMM 操作中,来加速大语言模型 (LLM) 的推理。这些方法使用为 NVIDIA H100 GPU 定制的 CUTLASS 内核实现,显著减少了中间张量物化的相关开销。在 Qwen 2.5 模型上的评估显示,与标准的 PyTorch 实现相比,速度提升高达 2.47 倍,实现了更高的峰值 BF16 利用率,并展示了优于 cuBLAS 等现有库的数值性能。

  14. RESEARCH · CL_79592 ·

    AutoMegaKernel 将 Llama 模型编译为单个 CUDA 核函数

    研究人员开发了 AutoMegaKernel (AMK) 系统,该系统将 HuggingFace Llama 系列模型编译成单个、持久的 CUDA 核函数,以实现高效的前向传播。AMK 的静态验证器可确保调度安全,防止死锁和竞用条件。该系统支持从单一代码库支持多种 NVIDIA GPU 架构,并已展示出自我改进能力。

  15. RESEARCH · CL_54660 ·

    可预测数据使GPU矩阵乘法更快

    研究人员发现,当输入数据“可预测”时,GPU上的矩阵乘法可以执行得更快。最初,一个名为CUTLASS的项目显示比NVIDIA的CuBLAS提高了10%的性能。然而,当在Python中进行基准测试时,这种提升消失了。进一步的调查显示,CUTLASS的分析器默认使用整数初始化的输入,这导致了观察到的加速。当将零初始化的矩阵与随机初始化的矩阵进行比较时,零初始化的矩阵产生了显著更高的Teraflops,这表明数据内容本身会影响matmul性能。

  16. RESEARCH · CL_21392 ·

    DeepSeek V4 通过自定义内核取代 cuBLAS 实现更快的性能

    DeepSeek 开发了一个自定义内核栈 DeepGEMM 和 TileLang,其性能不仅媲美,而且超越了 NVIDIA 的 cuBLAS。此自定义实现实现了比特级确定性和批次不变性,解决了其他工作负载平衡策略(如 splitK 或 split-KV)中常见的非确定性输出问题。这项创新在于其浮点数学方法,确保了调试和训练结果的一致性。