像 Llama-3.1 这样的大型语言模型在本地进行推理时,由于一个根本性的瓶颈:模型权重从内存中访问的速度,常常会显得 GPU 资源利用不足。生成单个 token 需要读取所有模型权重,这个过程比现代 GPU 的计算能力慢得多。这意味着 GPU 的算术单元大部分时间处于空闲状态,等待数据,而不是执行计算。虽然将多个用户的请求进行批处理可以在托管推理中克服这一点,但单个用户无法实现这种效率,从而导致了感知到的利用不足。 AI
影响 解释了为什么本地 LLM 推理性能受内存带宽限制,而不是 GPU 计算能力。
排序理由 解释了本地 LLM 推理的一个技术限制,而不是一个新发布或事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →