AWS 为 Amazon SageMaker HyperPod 上的大型语言模型 (LLM) 开发了一种分层 KV 缓存架构,利用 Curvine 将缓存内存从 GPU 和 CPU 扩展到共享 NVMe 池。该方法旨在通过实现不同推理副本之间的缓存重用,来降低基础设施成本并改善用户体验。该系统在跨 Pod 缓存命中率方面达到了 100%,在处理约 1,900 个 token 的提示时,首次 token 时间缩短了 2.7 倍。 AI
影响 优化了 AWS 上 LLM 推理的成本和性能,可能促进大型模型的更广泛应用。
排序理由 该文章描述了在特定云平台上优化 LLM 推理的技术实现,而非新的模型发布或核心研究。
在 AWS Machine Learning Blog 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →