Reddit r/LocalLLaMA 子版块的一位用户分享了 Muse Glimmer 30B 模型令人印象深刻的性能基准测试,在 RTX 5090 GPU 上实现了每秒 253 个 token。该速度是通过使用特定的量化方法 (UD-Q5_K_M) 和一个将 DFlash draft argmax 从 CPU 移至 GPU 的 draft PR (#26842) 实现的,从而解决了瓶颈问题。用户指出,此优化与 Meta 公布的速度相匹配,并且在编码工作负载上优于 ngram-simple 等其他方法。 AI
影响 展示了本地 LLM 推理速度的显著提升,有可能在消费级硬件上实现更复杂的应用。
排序理由 用户对现有模型进行的优化基准测试,并非来自前沿实验室的新发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →