两篇新研究论文探讨了使用大型语言模型 (LLM) 生成正确 GPU 内核的挑战。第一篇论文《LLM 生成的 GPU 内核中的正确性幻觉》指出,现有基准测试可能由于固定形状、小样本检查而错误地将有缺陷的内核认证为正确。它提出了一种具有高精度 CPU 引用的模糊测试方法,以在各种 GPU 架构中捕获这些“LLM 式转录错误”。第二篇论文《从 Token 到区域:面向 GPU 内核生成的 CUDA 敏感指令调优》介绍了一种名为 CuSeT 的新方法。该技术在 Token 和区域级别都关注 CUDA 敏感性,利用高置信度 Token 并保留低置信度关键区域,以提高功能正确性并降低与现有基于 LLM 的生成方法相比的推理成本。 AI
影响 新方法旨在提高 LLM 生成的 GPU 内核的正确性和效率,这对于扩展 AI 系统至关重要。
排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了与 LLM 生成的 GPU 内核相关的新颖方法和发现。
- CUDA
- Hugging Face
- Joseph Anton
- large-language models
- reinforcement learning
- supervised fine-tuning
- GPU kernel
- KernelBench
- LLM
- Triton
- TritonBench
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →