PulseAugur
中
实时 06:18:11
实体 Nsight Compute

Nsight Compute

PulseAugur coverage of Nsight Compute — every cluster mentioning Nsight Compute across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_252161 ·

    新的 LLM 推理技术提高了 GPU 利用率和效率

    研究人员开发了一种新的方法来剖析 LLM 推理的 GPU 利用率,超越单一百分比,提供源自 Nsight Compute 报告的八个详细视图。该方法将利用率差距映射到诸如片段填充和占用限制等特定机制,从而更精细地理解 Nvidia Hopper 架构上的性能。另外,中国移动云推出了结合 GPU 和神经形态处理器的异构 LLM 推理堆栈,声称在 DeepSeek V4 Flash 等模型的输出、能源效率和运营成本降低方面取得了显著的进步。

  2. TOOL · CL_195962 ·

    手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

    一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…