PulseAugur
实时 17:20:23
实体 Parallel Thread Execution

Parallel Thread Execution

PulseAugur coverage of Parallel Thread Execution — every cluster mentioning Parallel Thread Execution across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_195962 ·

    手写 PTX 内核在 NVIDIA L4 GPU 上为 INT8/INT4 GEMM 带来显著加速

    一篇新的研究论文探讨了在 NVIDIA L4 GPU 上使用手写 PTX(并行线程执行)内核进行 GEMM(通用矩阵乘法)运算的性能优势,与标准的 WMMA(Warp Matrix Multiply Accumulate)C++ API 相比。研究发现,虽然手写 PTX 在 FP16 精度下没有带来加速,但在 INT8(1.4倍-1.8倍)和 INT4(2.9倍-4.3倍)精度下实现了显著的性能提升。这些加速归因于指令数减少、全局内存…

  2. RESEARCH · CL_135430 ·

    Tessera系统为AI工作负载解锁异构GPU

    一个名为Tessera的新系统已被开发出来,以提高在异构GPU集群上运行大型AI模型的性能和成本效益。与之前在粗粒度级别运行的方法不同,Tessera在内核级别分解工作负载,认识到不同的内核具有不同的资源需求。这种方法可以更精确地将计算与硬件能力对齐,从而在服务吞吐量和成本效益方面取得显著改进。Tessera还展示了对新模型架构的泛化能力,甚至可以在更低的成本下超越同构GPU设置。

  3. TOOL · CL_102701 ·

    开源 Nvidia Vulkan 驱动 NVK 在 Linux 上增加了实验性 DLSS 支持

    为 Nvidia GPU 在 Linux 上开发的开源 Vulkan 驱动 NVK,已引入对 Nvidia DLSS 超分辨率技术(upscaling technology)的实验性支持。此集成是通过直接加载预编译的 CUDA 二进制文件实现的,而不是重新实现 DLSS 算法本身。这种变通方法意味着 DLSS 功能取决于特定 GPU 是否有兼容的字节码可用,而 Nvidia 的专有驱动程序没有此限制,它会在运行时编译中间代码。

  4. RESEARCH · CL_71845 ·

    前OpenAI技术主管加入SemiAnalysis寻找GPU编译器漏洞

    前OpenAI技术主管Justin Lebar已加入SemiAnalysis担任访问学者。在此职位上,他将专注于识别AMDGPU LLVM、x86 LLVM和NVPTX中的漏洞。该项目旨在通过在有限的时间和预算内采用编译器模糊测试技术来发现大量漏洞。

  5. TOOL · CL_52483 ·

    WAVE 项目创建统一 GPU ISA 以实现跨供应商兼容性

    一种名为 WAVE 的新型便携式 GPU 指令集架构 (ISA) 已被开发出来,旨在统一不同硬件供应商之间的编程。WAVE 抽象了在 NVIDIA、AMD 和 Intel GPU 中发现的常见功能,允许开发人员编写一次内核,然后将其编译到 Metal、PTX、HIP 或 SYCL 等各种后端。事实证明,这种方法可以在 Apple、NVIDIA 和 AMD 的硬件上产生相同的训练结果。

  6. RESEARCH · CL_24751 ·

    NVIDIA 发布实验性 Rust 到 CUDA 编译器后端

    NVIDIA AI 研究人员推出了 cuda-oxide,这是一个实验性编译器,允许开发人员使用 Rust 编写 GPU 内核,并直接将其编译为 PTX(NVIDIA 的 GPU 中间表示)。这个新工具旨在将 CUDA 编程模型直接引入安全的 Rust 环境,无需 C++ 或其他中间语言。该项目使用了一个自定义的 rustc 代码生成后端和一个名为 Pliron 的原生 Rust MLIR 类框架,允许主机和设备代码共存于单个源文件中。