在 Kubernetes 上部署大型语言模型的服务领域正在迅速发展,许多曾经开放的挑战现在已被资金雄厚的项目和标准所解决。KV 缓存感知路由、预填充/解码分离、分数 GPU 共享和基本 GPU 调度原语等领域正变得拥挤。然而,仍然存在显著的差距,特别是在将模型权重分发视为一等 Kubernetes 原语方面,这目前会导致漫长的冷启动时间。 AI
影响 强调了高效 LLM 部署的关键基础设施差距,特别是在减少大规模应用的冷启动时间方面。
排序理由 文章分析了 Kubernetes 上 LLM 服务的现有和新兴解决方案,引用了学术论文和项目。[lever_c_demoted from research: ic=1 ai=0.7]
- arXiv 2607.16596
- arXiv 2609.20874
- Gateway API Inference Extension
- GKE Inference Gateway
- Grove
- KAI Scheduler
- Kubernetes
- Kueue
- llm-d
- NVIDIA Dynamo
- NVIDIA GPU Operator
- Run:ai
- vCluster
- Volcano
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →