研究人员开发了 KernelBrain,一个旨在优化 GPU 内核的智能体系统。该系统采用粗粒度到细粒度的方法,利用 LLM 指导的变异和自适应资源分配来高效搜索最优内核变体。KernelBrain 在投入更高保真度的预算给有希望的候选者之前,会通过低成本评估来筛选大量候选者,从而提高内核质量和搜索效率。在 Triton 内核生成测试中,KernelBrain 与 PyTorch 和现有的最先进内核智能体相比,实现了显著的加速,同时还减少了优化时间。 AI
影响 这项研究通过优化底层 GPU 内核性能,可能带来更高效的 AI 模型训练和推理。
排序理由 详细介绍 GPU 内核优化新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →