NVIDIA Triton
PulseAugur coverage of NVIDIA Triton — every cluster mentioning NVIDIA Triton across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
FlashVector 代理将 AI 模型服务栈优化至 2 倍吞吐量
研究人员开发了 FlashVector,一个旨在优化生产推荐系统中模型服务的性能并降低相关成本的代理系统。该系统通过将优化技术推广到异构技术栈,解决了从 GPU 内核到特征处理的多个层面的优化复杂性。在 Unity 的 Vector 广告平台上部署后,FlashVector 取得了显著的改进,包括模型服务器吞吐量提高高达 2 倍,延迟提高 1.98 倍,以及特征存储吞吐量提高 1.6 倍。
-
使用 ONNX 和 TensorRT 通过 NVIDIA Triton 部署 YOLOv8
本文详细介绍了如何使用 NVIDIA Triton 推理服务器部署 YOLOv8 对象检测模型。文章解释了将 YOLOv8 的 ONNX 格式转换为 TensorRT(一种高性能推理优化器)的过程,然后通过 Triton 的原生 TensorRT 后端进行部署。该指南特别强调了使用 Triton Control 来简化为高效模型部署创建特定目标 TensorRT 计划的过程。
-
使用 vLLM 在 NVIDIA Triton 上部署 Phi-3 以实现 MLOps
本文详细介绍了如何使用 vLLM 在 NVIDIA Triton(一款流行的推理服务软件)上部署 Phi-3 语言模型。文章重点介绍了如何利用 Triton 的 vLLM 后端高效地服务 Phi-3 并维护可移植的模型路径,适用于包括 S3 支持的系统在内的各种部署环境。该指南强调了 MLOps 工程师将这些技术集成到实际操作中的步骤。
-
Netflix 使用 NVIDIA Triton 和 vLLM 构建内部 LLM 服务平台
Netflix 开发了一个内部平台来管理大规模 LLM 推理,利用 NVIDIA Triton 进行模型管理,并使用 vLLM 进行推理。该系统旨在在生产环境中高效部署自定义模型。最近的一份报告详细介绍了其架构、设计选择和实施过程中吸取的经验教训。
-
NVIDIA Triton 和 Triton Control:部署机器学习模型
本文详细介绍了使用 NVIDIA Triton 和 Triton Control 部署机器学习模型的两种实用工作流程。内容涵盖部署现有的 Triton 仓库以及导出和提供开源模型。
-
批量处理 vs. 实时推理:选择正确的图像生成方法
图像生成的批量处理与实时推理之间的选择,取决于输出是需要立即获得还是可以稍后处理。批量处理通过对相似请求进行分组并最大化GPU利用率,优先考虑最大吞吐量和成本效益,非常适合生成大型产品目录或营销素材等任务。相反,实时推理则侧重于面向用户的应用程序的快速响应时间,通常需要备用GPU容量来满足延迟目标。
-
Amazon SageMaker AI 通过容器缓存加速模型扩展
Amazon SageMaker AI 推出了容器缓存功能,以加速推理过程中的模型扩展。此新功能通过消除新实例预配时下载容器镜像的时间,将生成式 AI 模型的端到端延迟最多降低 51%。对于大型模型和复杂工作负载,此改进尤为显著,在测试案例中将启动时间从 525 秒缩短至 258 秒。