研究人员正在开发新的方法来优化跨不同硬件的大型语言模型(LLM)推理和训练。Meganeura旨在通过Vulkan和Metal实现便携式GPU训练和推理,并展示出与供应商特定解决方案相比具有竞争力的性能。Celty通过共同设计GPU内核和SIMT微架构以实现稀疏矩阵-稀疏向量工作负载,专注于高效的双稀疏LLM推理。此外,一种新的分析方法无需直接测量即可估算GPU上LLM推理的能耗,有助于可持续性分析。 AI
影响 新技术有望在更广泛的硬件上实现更高效、更易于访问的LLM部署。
排序理由 多篇研究论文详细介绍了在GPU上优化LLM推理和训练的新方法。
在 Hugging Face Daily Papers 阅读 →
- Mastodon
- graphics processing unit
- AirLLM
- DeepSeek-V3
- Hugging Face
- Kimi K3
- Llama 3.1
- NVIDIA
- NVIDIA H100
- AMD
- Apple Inc.
- LLM
- Meganeura
- Metal
- PyTorch
- Rocm
- Vulkan
AI 生成摘要 · Google Gemini · 来自 9 个来源。 我们如何撰写摘要 →