一项提交给 llama.cpp 项目的拉取请求引入了针对混合专家(MoE)模型的 CUDA 优化。这些增强功能旨在通过将融合能力扩展到单 token 操作之外,来提高性能,特别是在投机解码和 MoE 路由方面。这些更改有望在各种草稿宽度下为 MoE 模型带来速度提升,基准测试显示出有希望的结果。 AI
影响 这些优化可以提高在本地运行 MoE 模型的效率,从而可能使其更容易被硬件有限的用户使用。
排序理由 这是一个针对特定软件项目(llama.cpp)的拉取请求,它为特定的模型架构(MoE)引入了优化,而不是核心 AI 发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →