PulseAugur
实时 10:02:55
English(EN) I hosted Kimi K3 (2.8T parameters) using 8 B300s. 92 tok/s, $190 per million tokens

Kimi K3 LLM 使用 8 个 B300 GPU 托管,达到 92 token/秒

一位用户详细介绍了他们使用八个 B300 GPU 托管拥有 2.8 万亿参数的 Kimi K3 大型语言模型的经验。该设置实现了每秒 92 token 的吞吐量,首次 token 时间约为 1 秒,每百万输出 token 的成本为 190 美元。用户还尝试了 Unsloth 的 Dynamic GGUF,发现其速度明显较慢,每 token 成本更高,尽管质量被认为是可接受的。 AI

影响 展示了超大型模型的实际托管成本和性能,为基础设施决策提供信息。

排序理由 用户驱动的大型语言模型基础设施部署和性能测试。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Kimi K3 LLM 使用 8 个 B300 GPU 托管,达到 92 token/秒

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/OtherRaisin3426 ·

    我使用 8 个 B300 托管了 Kimi K3(2.8T 参数)。92 token/秒,$190 每百万 token

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vw1j2p/i_hosted_kimi_k3_28t_parameters_using_8_b300s_92/"> <img alt="I hosted Kimi K3 (2.8T parameters) using 8 B300s. 92 tok/s, $190 per million tokens" src="https://preview.redd.it/rxwvasuh43lh1.png?width=6…