一位用户详细介绍了他们使用八个 B300 GPU 托管拥有 2.8 万亿参数的 Kimi K3 大型语言模型的经验。该设置实现了每秒 92 token 的吞吐量,首次 token 时间约为 1 秒,每百万输出 token 的成本为 190 美元。用户还尝试了 Unsloth 的 Dynamic GGUF,发现其速度明显较慢,每 token 成本更高,尽管质量被认为是可接受的。 AI
影响 展示了超大型模型的实际托管成本和性能,为基础设施决策提供信息。
排序理由 用户驱动的大型语言模型基础设施部署和性能测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →