Ray Serve
PulseAugur coverage of Ray Serve — every cluster mentioning Ray Serve across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AWS 推出新的 Ray Serve 容器,简化 AI 推理流程,因 TorchServe 已弃用
AWS 发布了新的深度学习容器 (DLCs),利用 Ray Serve 来简化和支持之前由 TorchServe 管理的工作负载。TorchServe 已不再积极维护,用户需要自行负责管理其依赖项、安全补丁和兼容性问题。新的 Ray Serve DLCs 可用于 Amazon EKS 和 Amazon SageMaker,将 PyTorch、CUDA 和 Ray Serve 打包到一个经过测试和维护的容器中,减少了工程师的重复性工作,…
-
Ray Serve 延迟问题影响 MLOps 性能
一位开发者发现,模型服务框架 Ray Serve 在其 MLOps 管道中引入了大约 67 毫秒的延迟。这种延迟并不明显,被描述为“悄悄偷走”了性能。这个问题凸显了在 MLOps 中进行细致性能监控的重要性,以识别和解决细微的性能下降。
-
Anyscale 详细介绍了用于视频索引服务的 Ray Serve 异步推理
Anyscale 详细介绍了其 Ray Serve 中异步推理功能的一个实际实现,并展示了其在视频索引服务中的应用。该服务利用 Redis 或 RabbitMQ 等消息队列进行后台处理,能够高效地处理视频分析等长时间运行的任务,而不会阻塞客户端请求。该架构包括用于入口、视频消费和分块以及基于 GPU 的嵌入的独立部署,并根据队列深度和 GPU 负载进行自动扩展。
-
Google Ray Serve 在 TPU 上简化多主机 AI 推理
Google 展示了 Ray Serve 在其张量处理单元 (TPU) 上的运行情况,重点关注多主机模型的 gang scheduling。这种方法旨在简化可扩展推理堆栈(超出单节点设置)的基础设施复杂性。该开发细节在 Google 的一篇博文中有所介绍,强调了大规模 AI 部署的实际应用。
-
Anyscale 通过在 AMD 上分离预填充-解码来降低 LLM 服务成本
Anyscale 通过分离推理的预填充和解码阶段,在 LLM 服务方面实现了显著的成本节省。该方法将提示处理与 token 生成分开,减少了干扰并提高了吞吐量。虽然这种方法可以降低高达 67% 的成本并提高每秒查询次数 2.3 倍,但它会增加操作复杂性,并可能略微增加首次 token 的时间。
-
Anyscale 为 vLLM 中的 MoE 模型增加了 Ray Serve 容错功能
Anyscale 为其 vLLM 服务引擎引入了新的容错功能,该引擎与 Ray Serve 集成。此增强功能专门解决了部署大型专家混合(MoE)模型的挑战,这些模型被分片到多个 GPU 上。当一个数据并行(DP)组中的单个 GPU 发生故障时,新系统现在可以识别并重新启动构成该 DP 组的整个 GPU 组,从而防止整个部署变得不可用。