PulseAugur
实时 09:20:11
English(EN) Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB

DeepSeek V4 Flash 模型在四块消费级 GPU 上以 100 token/秒的速度运行

一位用户成功配置并运行了 DeepSeek V4 Flash 模型,这是一个大型的 144 GiB MoE 模型,运行在四块 NVIDIA RTX 3060 12GB GPU 的配置上。该配置实现了约 100 token/秒的提示处理速度和 10 token/秒的文本生成速度,同时保持了高达 368,640 token 的上下文窗口。用户详细介绍了特定的 llama.cpp 参数和硬件配置,强调了微批次大小和张量放置对性能和显存使用的影响。 AI

影响 展示了在消费级硬件上高效部署大型 MoE 模型的能力,可能降低了高级 AI 实验的门槛。

排序理由 用户驱动的配置和性能报告,关于在消费级硬件上运行大型模型。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

DeepSeek V4 Flash 模型在四块消费级 GPU 上以 100 token/秒的速度运行

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/syscomua ·

    在 4 块 RTX 3060 12GB 上以约 100 token/秒 的速度运行 DeepSeek V4 Flash Q4_K_XL 进行提示处理

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vrqf4f/running_deepseek_v4_flash_q4_k_xl_at_100_toks/"> <img alt="Running DeepSeek V4 Flash Q4_K_XL at ~100 tok/s prompt processing on 4× RTX 3060 12GB" src="https://preview.redd.it/lav8jwie65kh1.jpeg?width=6…