研究人员正在开发利用大型语言模型 (LLM) 优化 GPU 内核生成的先进方法。其中一种方法在 MLSys 2026 上提出,使用以工程化为中心(harness-centered)的系统来约束、验证和分析 LLM 生成的代码,与基线实现相比实现了显著的加速。另一项研究引入了 Atrex-Bench,这是一个源自生产推理跟踪的基准测试,用于评估 LLM 生成的 GPU 内核,结果显示当前模型仅能达到硬件潜力的约 10%,并且经常依赖回退(fallbacks)。为了解决这个问题,开发了一个优化代理,成功地将这些回退转换为生产就绪的内核。此外,还创建了一个名为 ATSInfer 的系统,用于在消费设备上进行混合 CPU-GPU LLM 推理,通过张量级调度和异步协调将吞吐量提高了高达 3.29 倍。 AI
影响 这些进展可能显著提高各种硬件上 AI 模型推理的效率和性能,从而可能降低成本并提高可访问性。
排序理由 该集群包含多篇研究论文,详细介绍了 LLM 驱动的 GPU 内核生成和优化的新颖方法,包括基准测试和新的代理系统。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Atrex-Bench
- Atrex-Kernel-Agent
- DagsHub
- FlyDSL
- graphics processing unit
- Hugging Face
- PyTorch
- Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices
- central processing unit
- ATSinfer
- Claude Code
- codex
- FlashInfer
- LLM
- MLSys 2026
- Nvidia Blackwell B200 GPUs
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →