一位用户正在寻求GPU推荐,以在本地运行大型语言模型(如DSV4 Flash和Qwen3.8-Flash-Next)并获得良好性能,目标是生成速度达到40-50+ tokens/秒,预填充速度达到1000+ tokens/秒。用户需要至少128 GB的VRAM,并倾向于NVIDIA显卡(因为CUDA),但如果性能相当,也愿意考虑AMD。预算约为15000美元,硬件必须能安装在Dell R740服务器中,最好使用三块或更少的GPU。 AI
影响 为个人和组织本地运行LLM的硬件选择提供信息。
排序理由 用户关于运行LLM硬件的查询。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →