LLM 请求分两个不同的阶段进行处理,每个阶段都有自己的瓶颈。第一个阶段是“预填充”,模型同时处理整个用户提示,这个阶段计算密集,受 GPU 核心限制。此阶段会生成初始 token 和一个 KV 缓存,即保存在 VRAM 中的一组工作笔记。第二个阶段是“解码”,逐字生成答案的其余部分。在此阶段,瓶颈转移到 VRAM 和数据传输,因为必须为生成的每个单词读取整个模型权重,导致 GPU 核心基本未被充分利用。 AI
影响 理解 LLM 请求处理过程有助于优化推理性能和资源利用率。
排序理由 该条目解释了 LLM 处理的技术概念,而不是宣布新产品或研究。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →