实体
PagedWeight
PagedWeight
PulseAugur coverage of PagedWeight — every cluster mentioning PagedWeight across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
PagedWeight 将 MoE 服务内存减少 72%,精度达到 FP16
一篇新的预印本介绍了一种名为 PagedWeight 的技术,该技术可在运行时动态量化专家混合(MoE)模型权重。据报道,该方法可将 GPU 内存使用量减少 72%,同时将人工智能推理任务的吞吐量提高 1.94 倍。该方法旨在提高服务大型 MoE 模型 的效率。
-
PagedWeight 通过动态量化改进 MoE LLM 服务
一种名为 PagedWeight 的新方法已被开发出来,以提高服务混合专家(MoE)大型语言模型的效率。该方法在运行时动态量化 MoE 模型权重,将其精度与 KV 缓存的内存需求进行平衡。PagedWeight 旨在优化模型精度、内存消耗和吞吐量之间的权衡,与现有的量化基线相比,显示出显著的 GPU 内存节省和吞吐量改进。