PulseAugur
实时 15:02:10
实体 NVIDIA A100-SXM4-80GB

NVIDIA A100-SXM4-80GB

PulseAugur coverage of NVIDIA A100-SXM4-80GB — every cluster mentioning NVIDIA A100-SXM4-80GB across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_135633 ·

    PyTorch 性能分析指南剖析 Transformer 注意力机制

    这篇博客文章是关于 PyTorch 性能分析系列文章的第三篇,详细介绍了如何分析 Transformer 模型中注意力机制的性能。它将注意力算法分解为其核心 PyTorch 操作,例如矩阵乘法、缩放、掩码和 softmax。通过使用 PyTorch 的性能分析器,开发人员可以可视化这些操作,识别性能瓶颈,并理解 GPU 上的执行流程,包括意外的内存复制。

  2. TOOL · CL_85385 ·

    Hugging Face 博客详解 PyTorch nn.Linear 性能分析

    这篇博客文章详细介绍了如何对 PyTorch 代码进行性能分析,重点关注 `nn.Linear` 模块及其底层操作。文章解释说 `nn.Linear` 封装了矩阵乘法和加法,并且 PyTorch 通过在 CPU 上转置权重并将偏置加法通过尾声(epilogue)折叠到矩阵乘法内核中来优化这一点。文章使用 NVIDIA A100 GPU 和 Hugging Face 基础设施来展示性能分析跟踪。

  3. TOOL · CL_59386 ·

    Hugging Face 博客:用于 LLM 优化的 PyTorch Profiler 指南

    Hugging Face 发布了其博客系列的第一部分,详细介绍了如何使用 PyTorch 的 torch.profiler 工具。本指南旨在为开发人员揭开性能分析的神秘面纱,从基本的矩阵乘法和偏置加法运算开始。它解释了如何设置 profiler、解释 CPU 和 GPU 跟踪,并理解从 Python 调用到 CUDA 内核的流程,以实现未来的优化和编译。