研究人员开发了 Kernel Forge,一个开源的代理工具集,旨在自动生成和优化 LLM、视觉和扩散模型的 CUDA 内核。该工具接受未经修改的 PyTorch 模型,并利用蒙特卡洛树搜索探索优化路径,提供图形界面进行监控和调试。Kernel Forge 在多种模型(包括 ResNet-50、Stable Diffusion 3.5 Medium、Gemma 4-E2B 和 Qwen 3.5-35B-A3B)的各种内核上,性能得到了显著提升,优于 PyTorch 的 eager 模式。 AI
影响 通过自动化 GPU 内核优化来加速 AI 模型性能,减少对专家工程师的依赖。
排序理由 该集群描述了一篇研究论文,详细介绍了一种用于优化 CUDA 内核的新型代理工具集。[lever_c_demoted from research: ic=1 ai=1.0]
- CUDA
- DGX Spark
- Gemma 4-E2B
- Kernel Forge
- Monte Carlo tree search
- NVIDIA
- NVIDIA GB10 Grace Blackwell Superchip
- PyTorch
- Qwen 3.5-35B-A3B
- ResNet-50
- Stable Diffusion 3.5 Medium
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →