Tensor Cores
PulseAugur coverage of Tensor Cores — every cluster mentioning Tensor Cores across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的Im2win卷积方法提高了GPU性能和内存效率
研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。
-
预装了22GB显存的RTX 2080 Ti GPU出现在eBay上,用于AI任务
一家香港卖家正在eBay上以499美元的价格出售预装了22GB显存的NVIDIA RTX 2080 Ti显卡。这些较旧的GPU因其增加的显存容量和Tensor Cores而被重新用于AI任务,特别是大型语言模型和扩散模型工作负载。虽然不如新显卡强大,但这些改装过的2080 Ti为寻求更多显存的AI爱好者提供了一个经济实惠的选择。
-
NVIDIA AI 基础设施认证计划启动,提供培训资源
现已推出 NVIDIA 认证助理:AI 基础设施与运营 (NCA-AIIO) 认证的培训计划及相关资源。该计划包括录播课程、考试指南和模拟考试,并提供直播课程。一位学员分享了他们通过考试的经验,指出考试侧重于基础概念,并提供了视频概览和免费模拟测试等额外资源,以帮助他人备考。
-
AMD 以新的 Helios AI 系统和 GPU 挑战 Nvidia · 跟踪 4 个来源
AMD 正通过其新的 Helios 机架级系统(配备 72 个 Instinct MI455X GPU 和下一代 EPYC 处理器)挑战 Nvidia 在人工智能计算领域的统治地位。该集成解决方案旨在提供一个完整、即插即用的数据中心构建块,与 Nvidia 的组件式方法形成对比。AMD 的公告还包括新的 GPU 变体和软件增强功能,以支持其生态系统,将其定位为人工智能基础设施的可靠替代品。
-
大语言模型推理速度受硬件物理限制,而非模型复杂度
一篇文章探讨了大语言模型(LLM)推理的性能瓶颈,认为主要限制因素并非模型本身,而是硬件的底层物理限制,特别是内存带宽。文章解释说,GPU的设计是为了大规模并行处理,对大型数据集执行相同的操作,这对于AI工作负载至关重要。文章强调,LLM的推理速度取决于两个关键GPU资源中较慢的那个:计算能力和内存带宽,并引入了算力强度(arithmetic intensity)的概念来衡量这种关系。
-
GPU矩阵乘法优化技术详解
本文深入探讨了在现代GPU上优化矩阵乘法(matmul)的高级技术。内容涵盖了Tensor Cores等专用硬件功能和内存传输加速器(TMA),以及warp专业化策略。目标是提升对AI和机器学习工作负载至关重要的基础运算性能。
-
Together AI发布FlashAttention-3和-4,加速大语言模型处理
Together AI发布了FlashAttention-3和FlashAttention-4,这是其用于大语言模型的GPU加速注意力机制的重大升级。FlashAttention-3专为Hopper GPU设计,通过利用张量核心(Tensor Cores)和张量内存加速器(Tensor Memory Accelerator)等新硬件特性并支持FP8精度,实现了高达75%的利用率和比前代产品快1.5-2倍的速度。FlashAttenti…
-
Sakana AI、NVIDIA 发布 TwELL,加速 LLM 训练和推理
Sakana AI 和 NVIDIA 的研究人员开发了 TwELL,这是一种显著加速大型语言模型 (LLM) 操作的新方法。通过针对计算密集型的前馈层,TwELL 实现了高稀疏性,并在 GPU 上转化为实际性能提升。该方法在不影响模型准确性的情况下,训练速度最高提升 21.9%,推理速度最高提升 20.5%。