两篇新的研究论文介绍了用于大型语言模型(LLM)生成硬件加速器代码的基准测试和优化框架。第一篇论文KernelGenBench提供了一个统一的基准测试,用于评估LLM生成的Triton内核在不同算子源和硬件平台上的性能,揭示了基于代理的方法存在显著的性能差异和高令牌成本。第二篇论文提出了一个基于编译器的分层诊断系统,用于优化Ascend NPU等新兴加速器上的Triton内核,通过将运行时问题与编译器行为联系起来,实现了显著的加速。 AI
影响 这些进展旨在提高LLM生成的硬件加速器代码的效率和可移植性,可能加速专用内核的开发。
排序理由 两篇学术论文介绍了LLM生成代码的新基准测试和优化框架。
- arXiv
- Ascend 950
- Hugging Face
- LLM
- National Pingtung University of Science and Technology
- NPUKernelBench
- Triton
- AKO4all
- AutoKernel
- cuBLAS
- Huawei Ascend
- KernelGenBench
- NVIDIA
- PyTorch
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →