实体
ynankani
ynankani
PulseAugur coverage of ynankani — every cluster mentioning ynankani across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
llama.cpp 为 MoE 模型性能添加 CUDA 优化
一项提交给 llama.cpp 项目的拉取请求引入了针对混合专家(MoE)模型的 CUDA 优化。这些增强功能旨在通过将融合能力扩展到单 token 操作之外,来提高性能,特别是在投机解码和 MoE 路由方面。这些更改有望在各种草稿宽度下为 MoE 模型带来速度提升,基准测试显示出有希望的结果。
-
llama.cpp 更新优化 DGX Spark 上的 CUDA 性能
llama.cpp 项目发布了更新 b10481,其中包括针对 DGX Spark 上的 CUDA 和密集模型的优化。该版本引入了与 MMVQ(多查询向量量化)相关的更改,并为 warp 数量和批处理大小设置了特定参数。此外,它还通过允许非专家计算来处理专家混合(MoE)模型,并为 DGX Spark 配置进行了参数重命名。