PulseAugur
实时 14:34:34
English(EN) Need support for llama.cpp with multi GPU

用户寻求帮助以优化 llama.cpp 的多 GPU 大型语言模型推理

Reddit r/LocalLLaMA 版块的一名用户正在寻求帮助,以配置 llama.cpp 来有效利用多个 GPU 运行大型语言模型。他们在尝试将一个 120GB 的 Deepseek4 flash 模型分配到 Blackwell 5000 (48GB) 和 3090 (24GB) GPU 上时遇到了性能问题,并注意到性能没有如预期般提升,有时甚至会下降。用户详细介绍了他们的设置、模型大小以及尝试过的各种命令行标志组合,包括不同的分割模式和手动层分配,但尚未实现最佳的多 GPU 性能。 AI

影响 优化本地大型语言模型推理的多 GPU 设置可以提高在消费级硬件上运行大型模型的用户性能和可访问性。

排序理由 用户关于优化现有软件以适应硬件配置的查询。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

用户寻求帮助以优化 llama.cpp 的多 GPU 大型语言模型推理

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/erazortt ·

    需要 llama.cpp 支持多 GPU

    <!-- SC_OFF --><div class="md"><p>Using llama.cpp I seem to be unable to get my to GPUs working tougether correclty, so I need help somehow.</p> <p>Setup: 96GB RAM, one Blackwell 5000 (48GB) and one 3090 (24GB).</p> <p>I am trying to run the UD-Q3_K_XL quant of Deepseek4 flash wh…