cuDNN: Efficient Primitives for Deep Learning
PulseAugur coverage of cuDNN: Efficient Primitives for Deep Learning — every cluster mentioning cuDNN: Efficient Primitives for Deep Learning across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的Im2win卷积方法提高了GPU性能和内存效率
研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。
-
新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源
三篇新的研究论文介绍用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶尖排名。
-
中文解析器DeepDoc、MinerU在日本RAG表现上出现交叉
对两个中文开源文档解析器DeepDoc和MinerU在日本RAG系统中的比较分析显示,基于所使用的检索方法,它们的性能出现了交叉。DeepDoc在使用BM25检索时表现出更优异的结果,而MinerU在使用密集检索时表现出色。这表明最佳解析器的选择取决于具体的检索策略,而不是某一个解析器普遍更好。
-
新方法利用世界模型加速张量程序优化
研究人员开发了一种新颖的方法来优化机器学习系统的张量程序,将调度评估建模为潜在动态。这种受世界模型启发的 方法使用轻量级转换模型在连续潜在空间中预测程序状态,避免了昂贵的代码变异和编码。当在 TVM AutoScheduler 中实现时,与现有方法相比,它显著 降低了 GPU 和 CPU 上的子图延迟,并加速了全模型推理,所有这些都在减少的测量预算内完成。
-
Together AI发布FlashAttention-3和-4,加速大语言模型处理
Together AI发布了FlashAttention-3和FlashAttention-4,这是其用于大语言模型的GPU加速注意力机制的重大升级。FlashAttention-3专为Hopper GPU设计,通过利用张量核心(Tensor Cores)和张量内存加速器(Tensor Memory Accelerator)等新硬件特性并支持FP8精度,实现了高达75%的利用率和比前代产品快1.5-2倍的速度。FlashAttenti…
-
NVIDIA 在 12 年后开源 cuDNN 内核,包括 MoE 和稀疏注意力
NVIDIA 已开源其 cuDNN 库的部分内容,这是在闭源 12 年后的一项重大举措。此次发布包括 20 多个专家混合 (MoE) 内核和 NSA 稀疏注意力内核。这些内核的代码库大部分是用 Python CuTe-DSL 编写的,现已提供公开文档。