Google Cloud 已将张量处理单元 (TPU) 支持直接集成到 vLLM 服务引擎中。此增强功能使开发者能够弹性扩展高需求的嵌入式管道,特别是处理超过 15,000 个 token 的上下文。此次集成利用了 Google Kubernetes Engine 来高效管理这些 AI 工作负载。 AI
影响 增强了 AI 嵌入式管道的可扩展性和效率,特别是对于大型上下文窗口。
排序理由 这是云平台上现有工具 (vLLM) 的基础设施集成,而不是新的前沿模型发布或重大的行业范围事件。
在 Mastodon — fosstodon.org 阅读 →
- Google.Cloud
- Kubernetes
- vLLM
- Embedding Inference for Structured Multilabel Prediction
- Google Kubernetes Engine
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →