一项提交给 llama.cpp 项目的拉取请求为专家混合(MoE)模型引入了优化,特别是针对 Qwen 35B A3B 等架构。这项名为 MMVQ 的增强功能旨在通过在 CUDA 框架内融合共享专家来提高这些模型的速度。该更改由用户 am17an 提交,是优化本地大型语言模型性能的持续努力的一部分。 AI
影响 提高本地硬件上特定专家混合模型的推理速度。
排序理由 向开源项目提交拉取请求以优化模型推理。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →