PulseAugur
实时 17:56:38
English(EN) HTAM: Hierarchical Transition-Attended Memory for Operator Optimization

新的HTAM框架优化LLM的GPU内核

研究人员推出HTAM,一个旨在优化大型语言模型GPU内核的新框架。HTAM通过将优化经验组织成一个两级分层迁移图来解决基于LLM的代码生成中的粒度不匹配挑战。这种结构允许选择粗粒度的全局方向和细粒度的局部策略,从而更有效地指导CUDA代码生成。实验表明,与现有的基于LLM的方法相比,HTAM在正确性、快速解决方案率和加速方面有所提高。 AI

影响 这项研究可能通过自动化和改进底层GPU内核的优化,从而实现更高效的LLM部署。

排序理由 该集群包含一篇学术论文,详细介绍了使用LLM优化GPU内核的新框架。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的HTAM框架优化LLM的GPU内核

报道来源 [2]

  1. arXiv cs.CL TIER_1 English(EN) · Yining Zhang, Mingyang Yi, Chen Wang, Xuwen Xiang, Tianhe Jia, Zedong Dan, Chengqing Zong, Yue Wang ·

    HTAM:用于算子优化的分层过渡注意力记忆

    arXiv:2605.29734v1 Announce Type: new Abstract: High-performance GPU kernels are essential for efficient LLM deployment, yet optimizing them remains expertise-intensive. Recent LLM-based code generation makes automatic GPU operator generation promising, but operator optimization …

  2. arXiv cs.CL TIER_1 English(EN) · Yue Wang ·

    HTAM:用于算子优化的分层过渡注意力记忆

    High-performance GPU kernels are essential for efficient LLM deployment, yet optimizing them remains expertise-intensive. Recent LLM-based code generation makes automatic GPU operator generation promising, but operator optimization remains a hardware-aware search problem. Existin…