实体
Ray Serve
Ray Serve
PulseAugur coverage of Ray Serve — every cluster mentioning Ray Serve across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
Google Ray Serve 在 TPU 上简化多主机 AI 推理
Google 展示了 Ray Serve 在其张量处理单元 (TPU) 上的运行情况,重点关注多主机模型的 gang scheduling。这种方法旨在简化可扩展推理堆栈(超出单节点设置)的基础设施复杂性。该开发细节在 Google 的一篇博文中有所介绍,强调了大规模 AI 部署的实际应用。
-
Anyscale 通过在 AMD 上分离预填充-解码来降低 LLM 服务成本
Anyscale 通过分离推理的预填充和解码阶段,在 LLM 服务方面实现了显著的成本节省。该方法将提示处理与 token 生成分开,减少了干扰并提高了吞吐量。虽然这种方法可以降低高达 67% 的成本并提高每秒查询次数 2.3 倍,但它会增加操作复杂性,并可能略微增加首次 token 的时间。
-
Anyscale 为 vLLM 中的 MoE 模型增加了 Ray Serve 容错功能
Anyscale 为其 vLLM 服务引擎引入了新的容错功能,该引擎与 Ray Serve 集成。此增强功能专门解决了部署大型专家混合(MoE)模型的挑战,这些模型被分片到多个 GPU 上。当一个数据并行(DP)组中的单个 GPU 发生故障时,新系统现在可以识别并重新启动构成该 DP 组的整个 GPU 组,从而防止整个部署变得不可用。