一个名为 llm-d 的新开源项目旨在弥合 Kubernetes 的编排能力与大型语言模型 (LLM) 推理的特定需求之间的差距。llm-d 作为现有工具(如 vLLM 和 Kubernetes)之上的一个层,引入了新的对象和行为,使编排能够感知推理。它通过考虑缓存局部性和服务级别协议等因素来增强调度,并允许将预填充和解码阶段分离到不同的 GPU 池上。 AI
影响 该工具通过使编排更具推理感知能力,有可能提高 LLM 部署的效率和可扩展性。
排序理由 该条目描述了一个为现有基础设施添加功能的新开源项目,而不是核心 AI 模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →