实体
CuTe-DSL
CuTe-DSL
PulseAugur coverage of CuTe-DSL — every cluster mentioning CuTe-DSL across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
GB200 NVL72 服务成本通过软件升级削减 2.5 倍
针对 GB200 NVL72 的软件优化在不到 70 天的时间里将服务成本大幅降低了 2.5 倍。这些改进,特别是使用 CuTe-DSL 重写 NVFP4 MoE 内核并利用 NVL72 的高带宽铜背板,已应用于 Kimi 架构,该架构也为 xAI 的 Cursor Composer 2.5 提供支持。这一显著的成本降低凸显了软件工程对人工智能基础设施效率的影响。
-
Modal 优化 FlashAttention-4 以实现更快的 LLM 推理速度
Modal 改进了 FlashAttention-4 内核,以提高大型语言模型(LLM)的推理速度,尤其是在解码密集型工作负载方面。他们的贡献侧重于调整并行策略,例如从查询并行转向键/值并行,并使用张量内存加速器(TMA)支持不规则的全局内存访问。该公司发现 CUDA 模板领域特定语言(CuTe DSL)在开发方面非常有效,并预计随着对未来内核开发基于平铺的编程模型的增强支持,将会有进一步的改进。
-
NVIDIA 在 12 年后开源 cuDNN 内核,包括 MoE 和稀疏注意力
NVIDIA 已开源其 cuDNN 库的部分内容,这是在闭源 12 年后的一项重大举措。此次发布包括 20 多个专家混合 (MoE) 内核和 NSA 稀疏注意力内核。这些内核的代码库大部分是用 Python CuTe-DSL 编写的,现已提供公开文档。