PulseAugur
实时 21:23:28

Muse Glimmer 30B 模型在 RTX 5090 上达到 253 t/s 优化性能

Reddit r/LocalLLaMA 子版块的一位用户分享了 Muse Glimmer 30B 模型令人印象深刻的性能基准测试,在 RTX 5090 GPU 上实现了每秒 253 个 token。该速度是通过使用特定的量化方法 (UD-Q5_K_M) 和一个将 DFlash draft argmax 从 CPU 移至 GPU 的 draft PR (#26842) 实现的,从而解决了瓶颈问题。用户指出,此优化与 Meta 公布的速度相匹配,并且在编码工作负载上优于 ngram-simple 等其他方法。 AI

影响 展示了本地 LLM 推理速度的显著提升,有可能在消费级硬件上实现更复杂的应用。

排序理由 用户对现有模型进行的优化基准测试,并非来自前沿实验室的新发布。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Muse Glimmer 30B 模型在 RTX 5090 上达到 253 t/s 优化性能

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/patricious ·

    Achievable 253 t/s - unsloth/Muse Glimmer 30B UD-Q5_K_M on a 5090

    <!-- SC_OFF --><div class="md"><p>Benchmarked Muse Glimmer 30B on my RTX 5090 (32GB), 262k context, UD-Q5_K_M + dflash-kquant + mmproj.</p> <table><thead> <tr> <th align="left">Workload</th> <th align="left">Stock master + DFlash</th> <th align="left">ngram-simple</th> <th align=…