Moonshot AI开发的大语言模型Kimi K3,在其自身运行环境中提供了性能报告。该模型运行在八个NVIDIA B300 SXM6 GPU上,总计拥有2.2 TB的VRAM,其上下文窗口超过100万个token。虽然为单个用户提供了近乎即时的响应时间和快速的长上下文预填充速度,但自托管这一前沿模型的成本相当可观,估计每小时为89.52美元,这使得其每个token的成本远高于高级API提供商。 AI
影响 尽管提供了控制和低延迟,但自托管前沿模型对于单个用户来说并不经济高效。
排序理由 前沿实验室模型发布,附带系统卡和性能报告。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- DigitalOcean
- FlashInfer
- Kimi k3
- Mario
- Moonshot AI
- NVIDIA B300
- NVIDIA B300 SXM6
- OpenAI
- OpenCode CLI
- vLLM
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →