CuTe-DSL
PulseAugur coverage of CuTe-DSL — every cluster mentioning CuTe-DSL across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Together 利用 Nvidia Rubin GPU 的新功能优化推理 · 跟踪 4 个来源
Together 宣布了其推理和 OSS 能力的进步,利用了 Nvidia Rubin GPU 的新功能。该公司已更新其 b200 gemms 以整合 Rubin 更宽的 MMA 步长、增加的张量和共享内存以及 B 侧收集器。这些优化带来了显著的性能提升,其 16k nvfp4 gemm 达到了 22.4 pflops,ThunderKittens 在新硬件上实现了具有竞争力的速度。
-
Together AI 为 NVIDIA Vera Rubin Blackwell GPU 优化 ThunderKittens
Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅…
-
GB200 NVL72 服务成本通过软件升级削减 2.5 倍
针对 GB200 NVL72 的软件优化在不到 70 天的时间里将服务成本大幅降低了 2.5 倍。这些改进,特别是使用 CuTe-DSL 重写 NVFP4 MoE 内核并利用 NVL72 的高带宽铜背板,已应用于 Kimi 架构,该架构也为 xAI 的 Cursor Composer 2.5 提供支持。这一显著的成本降低凸显了软件工程对人工智能基础设施效率的影响。
-
Modal 优化 FlashAttention-4 以实现更快的 LLM 推理速度
Modal 改进了 FlashAttention-4 内核,以提高大型语言模型(LLM)的推理速度,尤其是在解码密集型工作负载方面。他们的贡献侧重于调整并行策略,例如从查询并行转向键/值并行,并使用张量内存加速器(TMA)支持不规则的全局内存访问。该公司发现 CUDA 模板领域特定语言(CuTe DSL)在开发方面非常有效,并预计随着对未来内核开发基于平铺的编程模型的增强支持,将会有进一步的改进。
-
NVIDIA 在 12 年后开源 cuDNN 内核,包括 MoE 和稀疏注意力
NVIDIA 已开源其 cuDNN 库的部分内容,这是在闭源 12 年后的一项重大举措。此次发布包括 20 多个专家混合 (MoE) 内核和 NSA 稀疏注意力内核。这些内核的代码库大部分是用 Python CuTe-DSL 编写的,现已提供公开文档。