Together 宣布了其推理和 OSS 能力的进步,利用了 Nvidia Rubin GPU 的新功能。该公司已更新其 b200 gemms 以整合 Rubin 更宽的 MMA 步长、增加的张量和共享内存以及 B 侧收集器。这些优化带来了显著的性能提升,其 16k nvfp4 gemm 达到了 22.4 pflops,ThunderKittens 在新硬件上实现了具有竞争力的速度。 AI
影响 对 Nvidia Rubin GPU 的优化可能会加速 AI 推理性能并实现更高效的大型模型训练。
排序理由 该集群详细介绍了 AI 推理的硬件优化和性能基准测试,涉及主要的硬件供应商 (Nvidia) 和重要的 AI 软件/基础设施公司 (Together)。
在 X — Together (inference / OSS) 阅读 →
- b200 gemms
- Cublas
- CuTe-DSL
- nvfp4 gemm
- Nvidia
- Nvidia Rubin Gpu
- NVL72
- Tensor Cores
- ThunderKittens
- Together
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →