新的 Kubernetes 算子正在涌现,以解决运行大型语言模型的成本问题,特别是闲置 GPU 烧钱的问题。Hearth 是一个处于 alpha 阶段的算子,允许用户声明式地服务开源 LLM,并在不使用时将其缩减至零,在冷启动期间缓冲请求。另一种方法是构建一个使用 NVML 的 KEDA 外部扩展器,以实现基于实际 GPU 利用率的自动扩展,从而减少对 Prometheus 等完整指标堆栈的需求。 AI
影响 通过减少闲置 GPU 的支出,实现 LLM 的经济高效的自托管。
排序理由 该集群描述了用于在 Kubernetes 上管理 LLM 部署的新软件工具和方法,侧重于运营效率和成本降低,而不是核心 AI 模型发布或研究突破。
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →