研究人员推出HTAM,一个旨在优化大型语言模型GPU内核的新框架。HTAM通过将优化经验组织成一个两级分层迁移图来解决基于LLM的代码生成中的粒度不匹配挑战。这种结构允许选择粗粒度的全局方向和细粒度的局部策略,从而更有效地指导CUDA代码生成。实验表明,与现有的基于LLM的方法相比,HTAM在正确性、快速解决方案率和加速方面有所提高。 AI
影响 这项研究可能通过自动化和改进底层GPU内核的优化,从而实现更高效的LLM部署。
排序理由 该集群包含一篇学术论文,详细介绍了使用LLM优化GPU内核的新框架。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →