一篇新论文在 Tensor-Memory Equilibrium (TME) 模型中引入了一个缺失的第四项,即残差解构成本。该项考虑了在矩阵乘法发生之前,特别是对于流式操作数,所需的每输入解构成本。作者使用 cuBLAS 仿真路径校准了这一项,并建立了一个操作强度阈值,低于该阈值,仿真性能将受到限制,不如原生 fp64。 AI
影响 改进了 AI 硬件的性能建模,可能影响内核优化和硬件设计选择。
排序理由 学术论文,详细介绍了理论模型的改进及其对硬件性能的影响。[lever_c_demoted from research: ic=1 ai=0.7]
- B300 GPU
- Cublas
- FP8 is All You Need (Part 1)
- GEMM
- General Matrix Vector Multiplication
- High-Bandwidth Memory (HBM)
- Nvidia
- Ozaki Scheme II
- Sparse matrix-vector multiplication
- Tensor-Memory Equilibrium (TME) model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →