研究人员开发了 WiSP(Working-Set Paging),一个新颖的系统,旨在使大型专家混合(MoE)模型能够在低资源硬件上运行,例如 24GB RTX 3090 GPU。WiSP 将 MoE 服务视为一个运行集问题,管理路由专家权重和 KV 缓存之间在有限 VRAM 上的竞争。在相同的内存限制下,该系统实现了高达静态卸载方法两倍的解码吞吐量。此外,还引入了一种称为 MV-WSA(Marginal-Value Working-Set Allocation)的内存分配策略,用于动态地在驻留专家和 KV 缓存之间分配 VRAM,从而提高预填充和解码操作的性能。 AI
影响 使得大型 MoE 模型能够部署在消费级硬件上,可能降低本地 AI 应用的门槛。
排序理由 该集群包含一篇学术论文,详细介绍了服务大型 AI 模型的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →