PulseAugur
实时 12:51:22
实体 Triton Inference Server

Triton Inference Server

PulseAugur coverage of Triton Inference Server — every cluster mentioning Triton Inference Server across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_150899 ·

    使用 Kubernetes 为多 GPU 工作负载扩展 Triton 推理服务器

    本文提供了一份在 Kubernetes 环境中跨多个 GPU 扩展 Triton 推理服务器的手册。它解决了在繁重流量下于单个 GPU 上运行多个生产模型所面临的挑战。该指南详细介绍了实例组、动态批处理和其他优化性能和效率的技术。

  2. TOOL · CL_129937 ·

    NVIDIA Dynamo 框架加速大语言模型代理推理

    NVIDIA 发布了 Dynamo,一个专为大语言模型 (LLM) 和代理系统推理设计的新开源框架。该框架解决了基于代理的 AI 不断变化的需求,这些需求涉及大量的顺序和并行模型及工具调用,这与 Triton 等旧推理服务器所设计的简单请求-响应模式不同。Dynamo 的 KV 路由功能专门用于加速这些复杂的代理工作流。

  3. TOOL · CL_56645 ·

    在 Triton 推理服务器上运行 PyTorch 和 ONNX 模型,无需 GPU

    本文详细介绍了如何使用 NVIDIA 的 Triton 推理服务器在单个推理服务器上同时运行 PyTorch 和 ONNX 模型。该过程在本地 Mac 环境中演示,无需 GPU,突显了该设置在 MLOps 实践中的灵活性和可访问性。