研究人员开发了CAKE,一个新颖的协同设计框架,它整合了编译器技术和AI代理以增强GPU内核演进。该系统允许代理编写一种称为CAKE IR的专业中间表示(IR),该IR详细说明了硬件调度、内存移动和同步。该框架旨在提高专家GPU内核的可复现性和性能,超越将编译器视为黑箱的局限性。早期结果显示,在NVIDIA GPU上,Flash-KMeans和Kimi Delta Attention等应用程序的速度显著提升,并有可能实现更广泛的内核泛化。 AI
影响 增强GPU内核性能和可复现性,可能加速AI模型的开发和部署。
排序理由 该集群描述了一个新颖的研究框架及其在学术论文中提出的性能评估。[lever_c_demoted from research: ic=1 ai=1.0]
- Ampere
- Blackwell
- CAKE
- CAKE IR
- CUDA
- Flash-KMeans
- FlashML
- Kimi Delta Attention
- k-means clustering
- k-nearest neighbors algorithm
- NVIDIA
- Nvidia B200
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →