Tensor Cores
PulseAugur coverage of Tensor Cores — every cluster mentioning Tensor Cores across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的FP4融合技术加速LLM预训练,性能优于bfloat16
研究人员开发了一种名为“面向格式的融合”(format-aware fusion)的新技术,利用四位浮点数(FP4)精度来加速大型语言模型的预训练。该方法优化了量化生产者和消费者的交互,与标准的bfloat16和Transformer Engine方法相比,实现了显著的速度提升。在Llama-3-family 8B预训练上的评估表明,优化的FP4路径可以实现更高的tokens/s/GPU,同时保持具有竞争力的甚至有所改善的训练损失终点…
-
Together 利用 Nvidia Rubin GPU 的新功能优化推理 · 跟踪 4 个来源
Together 宣布了其推理和 OSS 能力的进步,利用了 Nvidia Rubin GPU 的新功能。该公司已更新其 b200 gemms 以整合 Rubin 更宽的 MMA 步长、增加的张量和共享内存以及 B 侧收集器。这些优化带来了显著的性能提升,其 16k nvfp4 gemm 达到了 22.4 pflops,ThunderKittens 在新硬件上实现了具有竞争力的速度。
-
新的Im2win卷积方法提高了GPU性能和内存效率
研究人员开发了一种增强版的Im2win卷积方法,旨在提高GPU上的内存效率和性能。该更新方法支持CUDA核心上的全精度和Tensor Core上的半精度,并结合了锯齿形内存访问和异步数据移动等优化。在十二项CNN任务上的基准测试显示出显著的改进,新的Im2win比仅限CUDA的版本实现了高达2.8倍的TFLOPS,并在速度和内存使用方面都优于标准的cuDNN和基于GEMM的卷积。
-
预装了22GB显存的RTX 2080 Ti GPU出现在eBay上,用于AI任务
一家香港卖家正在eBay上以499美元的价格出售预装了22GB显存的NVIDIA RTX 2080 Ti显卡。这些较旧的GPU因其增加的显存容量和Tensor Cores而被重新用于AI任务,特别是大型语言模型和扩散模型工作负载。虽然不如新显卡强大,但这些改装过的2080 Ti为寻求更多显存的AI爱好者提供了一个经济实惠的选择。
-
NVIDIA AI 基础设施认证计划启动,提供培训资源
现已推出 NVIDIA 认证助理:AI 基础设施与运营 (NCA-AIIO) 认证的培训计划及相关资源。该计划包括录播课程、考试指南和模拟考试,并提供直播课程。一位学员分享了他们通过考试的经验,指出考试侧重于基础概念,并提供了视频概览和免费模拟测试等额外资源,以帮助他人备考。
-
AMD 以新的 Helios AI 系统和 GPU 挑战 Nvidia · 跟踪 4 个来源
AMD 正通过其新的 Helios 机架级系统(配备 72 个 Instinct MI455X GPU 和下一代 EPYC 处理器)挑战 Nvidia 在人工智能计算领域的统治地位。该集成解决方案旨在提供一个完整、即插即用的数据中心构建块,与 Nvidia 的组件式方法形成对比。AMD 的公告还包括新的 GPU 变体和软件增强功能,以支持其生态系统,将其定位为人工智能基础设施的可靠替代品。
-
大语言模型推理速度受硬件物理限制,而非模型复杂度
一篇文章探讨了大语言模型(LLM)推理的性能瓶颈,认为主要限制因素并非模型本身,而是硬件的底层物理限制,特别是内存带宽。文章解释说,GPU的设计是为了大规模并行处理,对大型数据集执行相同的操作,这对于AI工作负载至关重要。文章强调,LLM的推理速度取决于两个关键GPU资源中较慢的那个:计算能力和内存带宽,并引入了算力强度(arithmetic intensity)的概念来衡量这种关系。
-
GPU矩阵乘法优化技术详解
本文深入探讨了在现代GPU上优化矩阵乘法(matmul)的高级技术。内容涵盖了Tensor Cores等专用硬件功能和内存传输加速器(TMA),以及warp专业化策略。目标是提升对AI和机器学习工作负载至关重要的基础运算性能。
-
Together AI发布FlashAttention-3和-4,加速大语言模型处理
Together AI发布了FlashAttention-3和FlashAttention-4,这是其用于大语言模型的GPU加速注意力机制的重大升级。FlashAttention-3专为Hopper GPU设计,通过利用张量核心(Tensor Cores)和张量内存加速器(Tensor Memory Accelerator)等新硬件特性并支持FP8精度,实现了高达75%的利用率和比前代产品快1.5-2倍的速度。FlashAttenti…
-
Sakana AI、NVIDIA 发布 TwELL,加速 LLM 训练和推理
Sakana AI 和 NVIDIA 的研究人员开发了 TwELL,这是一种显著加速大型语言模型 (LLM) 操作的新方法。通过针对计算密集型的前馈层,TwELL 实现了高稀疏性,并在 GPU 上转化为实际性能提升。该方法在不影响模型准确性的情况下,训练速度最高提升 21.9%,推理速度最高提升 20.5%。