实体
Triton Inference Server
Triton Inference Server
PulseAugur coverage of Triton Inference Server — every cluster mentioning Triton Inference Server across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
使用 Kubernetes 为多 GPU 工作负载扩展 Triton 推理服务器
本文提供了一份在 Kubernetes 环境中跨多个 GPU 扩展 Triton 推理服务器的手册。它解决了在繁重流量下于单个 GPU 上运行多个生产模型所面临的挑战。该指南详细介绍了实例组、动态批处理和其他优化性能和效率的技术。
-
NVIDIA Dynamo 框架加速大语言模型代理推理
NVIDIA 发布了 Dynamo,一个专为大语言模型 (LLM) 和代理系统推理设计的新开源框架。该框架解决了基于代理的 AI 不断变化的需求,这些需求涉及大量的顺序和并行模型及工具调用,这与 Triton 等旧推理服务器所设计的简单请求-响应模式不同。Dynamo 的 KV 路由功能专门用于加速这些复杂的代理工作流。
-
在 Triton 推理服务器上运行 PyTorch 和 ONNX 模型,无需 GPU
本文详细介绍了如何使用 NVIDIA 的 Triton 推理服务器在单个推理服务器上同时运行 PyTorch 和 ONNX 模型。该过程在本地 Mac 环境中演示,无需 GPU,突显了该设置在 MLOps 实践中的灵活性和可访问性。