Infinigence 发布了一种名为 PDD 的新型跨集群异构推理架构,旨在提高大型模型推理的效率并降低成本。该架构将传统的 Prefill-Decode (PD) 分离分解为三阶段的 Prefill-RelayDecode-MainDecode (P-RLD-MD) 系统。通过利用本地的 RelayDecode 实例,PDD 有效地掩盖了通过广域网传输 KV Cache 所带来的时延,据称首次 Token 时延降低了 51.5%,每个 Token 的成本降低了 37.5%。 AI
影响 该架构通过优化推理效率,有望显著降低大型语言模型的运营成本并改善用户体验。
排序理由 该集群描述了一种新的 LLM 推理技术架构,包括其设计原则和性能声明,并在会议上发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →