PulseAugur
实时 11:44:34
English(EN) AMD llama.cpp: reducing MTP buffer overhead gave me 64K → 149K context for Qwen 27B

llama.cpp 补丁将 AMD GPU 上的 Qwen 上下文长度提升至 149K

Reddit 上的一位用户为 llama.cpp 开发了一个补丁,显著增加了在 AMD GPU 上运行的模型上下文长度。通过优化多令牌预测 (MTP) 缓冲区分配,该补丁使 Qwen 27B 模型的上下文长度最高可达 149K 个令牌,远高于默认的 64K。此优化对于具有多个 GPU 的 ROCm 配置尤其有利,与 Vulkan 后端相比,它提供了更好的性能和更长的上下文长度,尽管 Vulkan 仍然提供一些显存节省。 AI

影响 使在 AMD 硬件上本地部署的 LLM 能够拥有更长的上下文窗口,从而可能提高复杂任务的性能。

排序理由 用户开发的开源软件补丁,提高了性能。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

llama.cpp 补丁将 AMD GPU 上的 Qwen 上下文长度提升至 149K

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/ea_man ·

    AMD llama.cpp:减少 MTP 缓冲区开销使我的 Qwen 27B 上下文从 64K 提升至 149K

    <!-- SC_OFF --><div class="md"><p>Available context length with and without the patch:</p> <table><thead> <tr> <th align="left">Model: QWEN 27B</th> <th align="left">ROCm stock</th> <th align="left">patched</th> <th align="left">Vulkan stock</th> <th align="left">patched</th> </t…