Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅达到理论性能的 42-44% 左右。Together AI 的优化旨在将性能推向理论上限,目标是超过 22 PFLOPS,并达到与 cuBLAS 等现有库相媲美的速度。 AI
影响 对 NVIDIA Blackwell 架构的优化可以提高兼容硬件上的 AI 训练和推理性能。
排序理由 针对现有硬件架构的软件优化。
- Blackwell
- cuBLAS
- CuTE DSL
- FP8
- GEMM
- Hopper
- NVFP4
- Nvidia
- NVIDIA Vera Rubin NVL72
- ThunderKittens
- Together AI
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →