一个名为ATInfer的新系统已被开发出来,通过有效利用CPU和GPU资源来提高大语言模型(LLMs)在消费级设备上的性能。该系统在张量粒度上运行,动态调度数据移动和计算以优化性能。评估显示,与现有方法相比,ATInfer可以显著提高吞吐量和GPU利用率,从而改善本地大语言模型部署的用户体验。 AI
影响 优化了消费级硬件上的大语言模型性能,可能提高了本地AI模型的可访问性和可用性。
排序理由 该集群包含一篇详细介绍大语言模型推理新系统的研究论文,以及一篇比较本地大语言模型推理硬件的讨论。
- AMD Radeon AI Pro R9700
- Intel Arc Pro B70
- LLM
- NVIDIA Blackwell
- ATSinfer
- CPU
- consumer devices
- GPU
- PCI Express
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →