研究人员开发了 DynaExq,一个旨在优化内存有限的单 GPU 上专家混合(MoE)模型推理的新系统。该系统根据专家在运行时期的使用情况动态分配精度,优先使用高精度处理常用专家,而对不常激活的专家使用较低精度。这种方法旨在减小内存占用,并避免与专家卸载和预取相关的延迟问题,尤其是在激活模式密集时。使用 Qwen3-MoE 模型进行的实验表明,DynaExq 可以提高相对于静态量化方法的准确性,并显著提高相对于传统卸载技术的吞吐量。 AI
影响 这项研究可能能够更有效地在资源受限的硬件上部署大型 MoE 模型,从而降低推理成本。
排序理由 该条目是一篇研究论文,详细介绍了一种用于 MoE 模型的新推理系统。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →