实体
b10217
b10217
PulseAugur coverage of b10217 — every cluster mentioning b10217 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
llama.cpp PR 缓存 MoE 专家以加速本地 AI 推理 · 跟踪 4 个来源
llama.cpp 的一项新拉取请求引入了一种在 GPU 上缓存常用专家混合(MoE)层的方法,通过将 Qwen3.6-35B-A3B 等模型在显存有限的消费级硬件上的推理速度最高提升 2 倍。然而,这种优化并非普遍适用,由于开销原因,在某些情况下甚至可能降低性能。同时,llama.cpp 还迎来了其他更新,包括增强了对 Intel GPU 的 SYCL 支持,改进了 iGPU 和 WebGPU F16 性能,并为聊天模型引入了工具调…
-
llama.cpp 发布多个更新,改进性能和构建
llama.cpp 项目发布了多个更新,包括 b10567 版本,该版本为 macOS、Linux、Android 和 Windows 提供了 CI 改进和各种构建选项。之前的版本如 b10566 和 b10549 分别引入了版本升级和张量分割功能。其他更新解决了 b10539 中的 Vulkan 量化计算、b10545 和 b10538 中的 Metal 性能优化以及 b10536 中的服务器端模型加载等具体问题。b10537 版本…