Reddit r/LocalLLaMA 版块的一名用户正在寻求帮助,以配置 llama.cpp 来有效利用多个 GPU 运行大型语言模型。他们在尝试将一个 120GB 的 Deepseek4 flash 模型分配到 Blackwell 5000 (48GB) 和 3090 (24GB) GPU 上时遇到了性能问题,并注意到性能没有如预期般提升,有时甚至会下降。用户详细介绍了他们的设置、模型大小以及尝试过的各种命令行标志组合,包括不同的分割模式和手动层分配,但尚未实现最佳的多 GPU 性能。 AI
影响 优化本地大型语言模型推理的多 GPU 设置可以提高在消费级硬件上运行大型模型的用户性能和可访问性。
排序理由 用户关于优化现有软件以适应硬件配置的查询。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →