Tensor Memory Accelerator
PulseAugur coverage of Tensor Memory Accelerator — every cluster mentioning Tensor Memory Accelerator across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的 T-CCL 库利用 TMA 提升多 GPU AI 模型性能
研究人员开发了 T-CCL,这是一个专为大型 Transformer 模型中高效多 GPU 执行而设计的新型集体通信库。T-CCL 利用张量内存加速器 (TMA) 来卸载数据移动和归约操作,显著减少了 GPU 流式多处理器 (SM) 上所需的计算资源。这种减少使得通信和计算能够更好地并发执行,从而提高性能。评估显示,在资源受限的条件下,T-CCL 的性能比 NCCL 等现有库高出 3.42 倍,并提高了 vLLM 等系统中的端到端推理吞吐量。
-
GPU术语表:硬件、软件和性能详解
本条目是一个术语表,定义了与图形处理单元(GPU)及其架构相关的术语。它涵盖了流式多处理器、着色器核心和矩阵核心等硬件组件,以及CUDA编程模型和编译器实用程序等软件方面。该术语表还深入探讨了性能指标和潜在瓶颈,为理解GPU技术提供了全面的参考。
-
AMD 以新的 Helios AI 系统和 GPU 挑战 Nvidia · 跟踪 4 个来源
AMD 正通过其新的 Helios 机架级系统(配备 72 个 Instinct MI455X GPU 和下一代 EPYC 处理器)挑战 Nvidia 在人工智能计算领域的统治地位。该集成解决方案旨在提供一个完整、即插即用的数据中心构建块,与 Nvidia 的组件式方法形成对比。AMD 的公告还包括新的 GPU 变体和软件增强功能,以支持其生态系统,将其定位为人工智能基础设施的可靠替代品。
-
Modal 优化 FlashAttention-4 以实现更快的 LLM 推理速度
Modal 改进了 FlashAttention-4 内核,以提高大型语言模型(LLM)的推理速度,尤其是在解码密集型工作负载方面。他们的贡献侧重于调整并行策略,例如从查询并行转向键/值并行,并使用张量内存加速器(TMA)支持不规则的全局内存访问。该公司发现 CUDA 模板领域特定语言(CuTe DSL)在开发方面非常有效,并预计随着对未来内核开发基于平铺的编程模型的增强支持,将会有进一步的改进。
-
Together AI发布FlashAttention-3和-4,加速大语言模型处理
Together AI发布了FlashAttention-3和FlashAttention-4,这是其用于大语言模型的GPU加速注意力机制的重大升级。FlashAttention-3专为Hopper GPU设计,通过利用张量核心(Tensor Cores)和张量内存加速器(Tensor Memory Accelerator)等新硬件特性并支持FP8精度,实现了高达75%的利用率和比前代产品快1.5-2倍的速度。FlashAttenti…