AWS、NVIDIA 和 Heidi Health 合作,在 Amazon EC2 实例上将自动语音识别 (ASR) 推理成本降低了 75%。通过实施 NVIDIA MPS 和 NVIDIA Triton 推理服务器,他们实现了所需 GPU 实例数量的 75% 的降低,从 16 个减少到 4 个,同时保持了亚秒级延迟。这种优化解决了 ASR 中每个请求的 GPU 利用率低的问题,而传统的 CUDA 时间切片会导致大量硬件容量闲置。 AI
影响 优化 ASR 的推理成本,可能降低依赖语音识别的 AI 服务的运营费用。
排序理由 本文描述了使用现有硬件和软件降低成本的技术优化,而不是新产品发布或前沿模型。
在 AWS Machine Learning Blog 阅读 →
- Amazon Elastic Compute Cloud
- AWS
- CUDA
- Heidi Health
- Nemotron
- NVIDIA
- NVIDIA L40S GPU
- NVIDIA MPS
- NVIDIA Triton Inference Server
- ONNX
- tensorrt
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →