研究人员开发了两个新颖的系统 SparseDitto 和 KernelBrain,旨在优化各种计算任务的 GPU 内核性能。SparseDitto 利用基于 LLM 的代理生成稀疏矩阵运算的自定义 GPU 内核,在 NVIDIA 硬件上实现了比 cuSPARSE 等现有库显著的加速。KernelBrain 采用粗粒度到细粒度、预算感知的搜索策略来优化 GPU 内核,与 PyTorch 和其他最先进的内核代理相比,提高了质量和效率。 AI
影响 这些系统可以通过提高 GPU 计算的效率,显著加速科学计算、图分析和机器学习。
排序理由 该集群包含两篇研究论文,详细介绍了使用 AI 优化 GPU 内核的新颖方法。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →