llama.cpp 项目发布了 b11422 版本,其中包括对 CUDA 和 ROCm 架构的优化。具体来说,此次更新为 MUSA 引入了一个新的 vector lightning indexer kernel,解决了某些 MUSA 架构上的共享内存限制。通过分批处理,这一更改确保了具有 28 KB 静态共享内存上限的 MUSA 架构 21 和 22 可以有效地处理 indexer 查询。 AI
影响 在特定硬件配置上提升 AI 推理性能。
排序理由 这是对一个开源项目的软件更新,旨在优化特定硬件的性能,而不是一项新发布或重要的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →