Reddit 上的一位用户为 llama.cpp 开发了一个补丁,显著增加了在 AMD GPU 上运行的模型上下文长度。通过优化多令牌预测 (MTP) 缓冲区分配,该补丁使 Qwen 27B 模型的上下文长度最高可达 149K 个令牌,远高于默认的 64K。此优化对于具有多个 GPU 的 ROCm 配置尤其有利,与 Vulkan 后端相比,它提供了更好的性能和更长的上下文长度,尽管 Vulkan 仍然提供一些显存节省。 AI
影响 使在 AMD 硬件上本地部署的 LLM 能够拥有更长的上下文窗口,从而可能提高复杂任务的性能。
排序理由 用户开发的开源软件补丁,提高了性能。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →