实体
MMVQ
MMVQ
PulseAugur coverage of MMVQ — every cluster mentioning MMVQ across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
llama.cpp 为 Qwen 35B 等 MoE 模型添加 MMVQ 优化
一项提交给 llama.cpp 项目的拉取请求为专家混合(MoE)模型引入了优化,特别是针对 Qwen 35B A3B 等架构。这项名为 MMVQ 的增强功能旨在通过在 CUDA 框架内融合共享专家来提高这些模型的速度。该更改由用户 am17an 提交,是优化本地大型语言模型性能的持续努力的一部分。
-
llama.cpp 更新优化 DGX Spark 上的 CUDA 性能
llama.cpp 项目发布了更新 b10481,其中包括针对 DGX Spark 上的 CUDA 和密集模型的优化。该版本引入了与 MMVQ(多查询向量量化)相关的更改,并为 warp 数量和批处理大小设置了特定参数。此外,它还通过允许非专家计算来处理专家混合(MoE)模型,并为 DGX Spark 配置进行了参数重命名。