PulseAugur
实时 03:27:17
English(EN) I fit Muse Glimmer 30B, vision, DFlash and a real 256K context onto one 24 GB GPU. Regular code: 17.98 tok/s DFlash code: 84.64 tok/s Mixed agent work: 38.34 to

Muse Glimmer 30B 模型针对 24GB GPU 和 256K 上下文进行了优化

一位开发者成功优化了 Muse Glimmer 30B 模型,使其能够在单个 24GB GPU 上以 256K 的上下文窗口运行。这项利用 DFlash 技术的优化显著提高了性能,在 DFlash 代码生成方面达到了 84.64 tokens/sec,在混合代理工作方面达到了 38.34 tokens/sec。开发者指出,最快或最低困惑度的量化并未产生最佳结果,这表明在使用推测解码时,令牌吞吐量受到可预测性的影响。 AI

影响 展示了在消费级硬件上运行大型上下文模型方面效率的显著提高,有可能降低复杂 AI 任务的入门门槛。

排序理由 该条目详细介绍了特定 LLM 的技术优化和基准测试,属于研究类别。[lever_c_demoted from research: ic=1 ai=1.0]

在 Mastodon — fosstodon.org 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Muse Glimmer 30B 模型针对 24GB GPU 和 256K 上下文进行了优化

报道来源 [1]

  1. Mastodon — fosstodon.org TIER_1 English(EN) · [email protected] ·

    我将 Muse Glimmer 30B、vision、DFlash 和真正的 256K 上下文装入一块 24 GB GPU。常规代码:17.98 tok/s DFlash 代码:84.64 tok/s 混合代理工作:38.34 到

    I fit Muse Glimmer 30B, vision, DFlash and a real 256K context onto one 24 GB GPU. Regular code: 17.98 tok/s DFlash code: 84.64 tok/s Mixed agent work: 38.34 tok/s Full 262K KV: 21.56 tok/s The fastest quant lost. So did the lowest-perplexity one. With speculative decoding, tok/s…