PulseAugur
实时 06:43:39
English(EN) Extremely slow DSpark draft model performance (1-2 t/s) with DeepSeek-V4-Flash on llama-server compared to MTP?

据报道 DeepSeek-V4-Flash 在 DSpark 草稿模型配置下存在性能问题

Reddit r/LocalLLaMA 版块的一名用户在使用 DSpark 草稿模型配置时,发现 DeepSeek-V4-Flash 模型的性能明显低于 Multi Token Prediction (MTP) 设置。MTP 配置可达到每秒 30-40 个 token 的可观速度,而 DSpark 配置则降至每秒仅 1-2 个 token。该用户正在寻求关于如何正确配置 llama-server 的推测解码以解决此瓶颈的建议,并提供了两种配置的详细硬件规格和命令行参数。 AI

影响 识别出本地 LLM 推理设置中潜在的性能瓶颈,影响用户体验和效率。

排序理由 用户报告本地 LLM 服务器上特定模型配置的性能问题。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

据报道 DeepSeek-V4-Flash 在 DSpark 草稿模型配置下存在性能问题

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/Easy_Werewolf7903 ·

    DeepSeek-V4-Flash 在 llama-server 上运行的 DSpark 草稿模型性能极慢 (1-2 t/s),与 MTP 相比如何?

    <!-- SC_OFF --><div class="md"><p>Hey everyone, I could use some advice on setting up speculative decoding correctly with <code>llama-server</code>.</p> <p><strong>My Hardware:</strong></p> <ul> <li><strong>GPUs:</strong> RTX 4090 + RTX 6000 Pro (120GB total VRAM)</li> <li><stron…