PulseAugur
中
实时 14:33:32
实体 Google Kubernetes Engine

Google Kubernetes Engine

PulseAugur coverage of Google Kubernetes Engine — every cluster mentioning Google Kubernetes Engine across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_261048 ·

    vLLM 和 GKE 用于大型语言模型

    本文讨论了使用 vLLM 和 Google Kubernetes Engine (GKE) 运行大型语言模型 (LLM) 的潜力。它建议软件开发人员和数据科学家可以利用这些技术来高效地部署和管理 AI 模型。提及 Hackaday 暗示了与 AI 应用相关的硬件和软件集成技术教程或新闻的背景。

  2. TOOL · CL_252462 ·

    NVIDIA 开源 OSMO 以统一 AI 机器人开发

    NVIDIA 已开源 OSMO,一个为简化物理 AI 开发而设计的原生 Kubernetes 工作流编排器。该工具允许机器人团队在单个 YAML 文件中定义训练、模拟和机器人测试流程,解决了不同计算层之间的碎片化问题。OSMO 支持跨各种 Kubernetes 环境和边缘设备的便携性,简化了机器人 AI 开发的复杂过程。

  3. TOOL · CL_222532 ·

    AI开发聚焦基础设施、代理和可靠部署 · 跟踪4个来源

    该集群强调了AI开发和基础设施的进步,侧重于实际应用和健壮的系统。其中一项详细介绍了用于构建能够通过Telnyx处理短信、语音通话和货运更新的AI货运代理的Python Flask示例。另一项介绍了moeinGTS AI Family,强调其轻量级、模块化和开源的特性,用于构建AI解决方案。第三篇文章强调了确定性基础设施、可观测代理和RAG可靠性清单对于生产级AI的重要性,超越了简单的提示词。最后,一项解释了Google Kubern…

  4. SIGNIFICANT · CL_221535 ·

    Google Cloud 在 TPU 上启用 vLLM 以支持 Qwen3 长上下文嵌入

    Google Cloud 为优化嵌入推理的张量处理单元(TPU)引入了原生的 vLLM 支持,旨在用于生产检索系统。此次更新侧重于增强 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 等模型的长上下文和多模态嵌入,解决了内存压力和池化正确性等挑战。Google 的工程努力包括优化张量对齐、编译预热以及混合 StepPool 设计,以确保数学正确性和高性能,其中一种配置实现了超过 83,000 to…

  5. TOOL · CL_220469 ·

    Google Cloud 将 TPU 支持集成到 vLLM 中,实现可扩展的嵌入式推理

    Google Cloud 已将张量处理单元 (TPU) 支持直接集成到 vLLM 服务引擎中。此增强功能使开发者能够弹性扩展高需求的嵌入式管道,特别是处理超过 15,000 个 token 的上下文。此次集成利用了 Google Kubernetes Engine 来高效管理这些 AI 工作负载。

  6. TOOL · CL_114729 ·

    新的代理提供自托管 LLM 的每个代理 GPU 成本跟踪

    开发了一个新的 LLM 推理代理,以解决自托管模型时 AI 代理成本可见性的差距。与专注于 token 数量的现有工具不同,该代理跟踪 GPU 小时消耗,提供每个代理和模型的精细成本数据。这有助于在迁移到不同 LLM 之前进行更好的预算管理、模型使用策略执行和影响分析。

  7. TOOL · CL_75732 ·

    面向 Agentic AI 的 MLOps:在 GKE 上扩展自主系统

    本文讨论了大规模部署 agentic AI 系统的运营挑战和解决方案,重点关注 Google Kubernetes Engine (GKE)。文章强调了从简单的问答模型转向复杂的自主代理,这些代理需要强大的基础设施来进行编排、监控和高效的资源管理。文章强调了先进的 MLOps 实践对于处理这些代理的动态性质的必要性。

  8. RESEARCH · CL_39673 ·

    NVIDIA 和 Google Cloud 通过新工具推动人工智能开发者社区发展

    NVIDIA 和 Google Cloud 正在扩展其联合开发者社区,旨在为超过 10 万名构建者提供人工智能工具和学习资源。该计划侧重于在 Google Cloud 中利用 NVIDIA 的人工智能平台,为 JAX 和推理优化提供新的学习路径。开发者现在可以在 Google Cloud 基础设施上利用 Google DeepMind 的 Gemma 和 NVIDIA 的 Nemotron 等模型,包括由 NVIDIA Blackwe…

  9. COMMENTARY · CL_28737 ·

    在 GKE 上自托管 LLM 常常因忽视成本和合规性而失败

    许多团队错误地选择在 Google Kubernetes Engine (GKE) 等基础设施上自托管大型语言模型,仅仅关注每个 token 的定价,而忽略了闲置计算成本和持续的运营责任等关键因素。相反,决策应由数据驻留和合规性要求、实际的持续 token 量以及组织管理复杂 GPU 基础设施的能力来驱动。忽视这些因素可能导致巨大的财务浪费和运营负担,使得托管 API 服务成为许多用例更经济实惠且实用的选择。

  10. TOOL · CL_26826 ·

    GKE Pod Snapshots 缩短 AI 模型冷启动延迟

    本文讨论了 Google Kubernetes Engine (GKE) Pod Snapshots 如何显著减少 AI 模型冷启动相关的延迟。通过捕获运行中 pod 的状态,这些快照可以实现更快的重启,这对于经常出现缓慢初始启动时间的 LLM(大型语言模型)尤其有利。该技术旨在提高 Kubernetes 上运行的 AI 驱动应用程序的响应能力。