一个由五名开发者组成的团队正在寻求关于最佳硬件配置的建议,以便为 agentic coding 任务自托管大型开放 MoE 模型,如 Kimi K2.6 和 DeepSeek V4。主要困境在于选择采用统一内存的双 GH200 NVL2 系统,还是提供更快 VRAM 的 8x RTX 6000 Blackwell 配置。用户已经测试过单个 GH200,取得了中等的解码速度,但担心预填充性能以及模型部分驻留在较慢的统一内存中。他们正在寻求实际性能数据,特别是并发情况下的解码和预填充数字,以便在 10 万至 15 万美元的预算内做出明智的决定。 AI
影响 为开发者提供有关选择本地 LLM 部署硬件的指导,影响 AI 团队的基础设施选择。
排序理由 讨论在本地运行特定 LLM 的硬件选择,并非新的模型发布或研究。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →