PulseAugur
实时 02:35:58
English(EN) Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB

DeepSeek V4 Flash 模型在消费级 GPU 上的详细运行表现

Reddit 的 r/LocalLLaMA 社区用户正在分享他们在各种硬件配置上运行 DeepSeek V4 Flash 模型的经验。一位用户详细介绍了一个使用两个 PLX88096 开关上的 16 个 NVIDIA RTX 5060 Ti GPU 的设置,实现了 500k 上下文(张量并行 8,流水线并行 2),或使用张量并行 4 和流水线并行 4 实现完整的 1M 上下文。另一位用户描述了在四块 RTX 3060 12GB 显卡上运行 DeepSeek V4 Flash Q4_K_XL 版本,管理了 360k-376k 的上下文窗口,并实现了约 100 token/秒的提示处理速度。 AI

影响 展示了在消费级硬件上优化大型模型推理的高级技术,可能降低研究人员和爱好者的入门门槛。

排序理由 用户分享的在消费级硬件上运行特定 LLM 的配置。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

DeepSeek V4 Flash 模型在消费级 GPU 上的详细运行表现

报道来源 [2]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Primary_Exchange21 ·

    运行 Deepseek V4 Flash-0731 130-150 tks 的无聊方法 - 16x5060ti 16GB 跨越 2 个 PLX88096 开关

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vthcwk/the_boring_way_to_run_deepseek_v4_flash0731/"> <img alt="The boring way to run Deepseek V4 Flash-0731 130-150 tks - 16x5060ti 16GB over 2 PLX88096 switches" src="https://preview.redd.it/ux4fggheqikh1.p…

  2. r/LocalLLaMA TIER_1 English(EN) · /u/syscomua ·

    在 4 块 RTX 3060 12GB 上以约 100 token/秒 的速度运行 DeepSeek V4 Flash Q4_K_XL 进行提示处理

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vrqf4f/running_deepseek_v4_flash_q4_k_xl_at_100_toks/"> <img alt="Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB" src="https://preview.redd.it/lav8jwie65kh1.jpeg?width=6…