vLLM 库现在通过一个实验性插件支持 GGUF 模型格式,使其能够在 NVIDIA 和 AMD GPU 上使用。然而,与原生支持 GGUF 文件的 Ollama 不同,vLLM 不支持在 CPU 上使用 GGUF。将 GGUF 与 vLLM 结合使用的主要好处是其连续批处理能力,可以从单个 GPU 为多个用户同时提供服务,而不是为了更快的推理速度。 AI
影响 通过 vLLM 为多用户服务,使现有 GGUF 模型在 GPU 上的使用范围更广。
排序理由 该条目讨论了将一种新的模型格式 (GGUF) 集成到现有的推理引擎 (vLLM) 中,这是一项工具改进。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →