研究人员开发了Kernel Forge,一个开源的代理式框架,它使用大型语言模型自动生成和优化PyTorch模型的CUDA内核。该工具旨在减少对专家工程师手动编写底层GPU代码的需求。Kernel Forge支持各种工作负载,包括视觉、扩散和LLM模型,并采用蒙特卡洛树搜索进行优化。它已显示出显著的速度提升,在多个内核上优于PyTorch的eager模式,并在ResNet-50和Gemma 4-E2B等模型上取得了显著改进。 AI
影响 加速AI模型的GPU内核优化,可能降低各种工作负载的推理延迟和成本。
排序理由 该集群描述了一个新的开源工具和研究论文,详细介绍了使用LLM优化CUDA内核的代理式框架。
在 Mastodon — sigmoid.social 阅读 →
- CUDA
- DGX Spark
- Gemma 4-E2B
- Kernel Forge
- Monte Carlo tree search
- NVIDIA
- NVIDIA GB10 Grace Blackwell Superchip
- PyTorch
- Qwen 3.5-35B-A3B
- ResNet-50
- Stable Diffusion 3.5 Medium
- University of Michigan
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →