Tensor Memory Accelerator
PulseAugur coverage of Tensor Memory Accelerator — every cluster mentioning Tensor Memory Accelerator across labs, papers, and developer communities, ranked by signal.
-
AMD 以新的 Helios AI 系统和 GPU 挑战 Nvidia · 跟踪 4 个来源
AMD 正通过其新的 Helios 机架级系统(配备 72 个 Instinct MI455X GPU 和下一代 EPYC 处理器)挑战 Nvidia 在人工智能计算领域的统治地位。该集成解决方案旨在提供一个完整、即插即用的数据中心构建块,与 Nvidia 的组件式方法形成对比。AMD 的公告还包括新的 GPU 变体和软件增强功能,以支持其生态系统,将其定位为人工智能基础设施的可靠替代品。
-
Modal 优化 FlashAttention-4 以实现更快的 LLM 推理速度
Modal 改进了 FlashAttention-4 内核,以提高大型语言模型(LLM)的推理速度,尤其是在解码密集型工作负载方面。他们的贡献侧重于调整并行策略,例如从查询并行转向键/值并行,并使用张量内存加速器(TMA)支持不规则的全局内存访问。该公司发现 CUDA 模板领域特定语言(CuTe DSL)在开发方面非常有效,并预计随着对未来内核开发基于平铺的编程模型的增强支持,将会有进一步的改进。
-
Together AI发布FlashAttention-3和-4,加速大语言模型处理
Together AI发布了FlashAttention-3和FlashAttention-4,这是其用于大语言模型的GPU加速注意力机制的重大升级。FlashAttention-3专为Hopper GPU设计,通过利用张量核心(Tensor Cores)和张量内存加速器(Tensor Memory Accelerator)等新硬件特性并支持FP8精度,实现了高达75%的利用率和比前代产品快1.5-2倍的速度。FlashAttenti…