一位用户详细介绍了他们使用六块 BC-250 板在本地运行大型语言模型的设置。他们偏好的配置是四块板运行 Qwen Next Flash IQ2_XS,具有 100k 上下文窗口,在短生成时达到约 28 tokens/sec,在 50k 上下文时达到 24 tokens/sec。其余两块板用于运行 3.6 35b q4 模型,具有 100k 上下文窗口,速度为 60 tokens/sec。整个设置使用 llama 配合 Vulkan 和 RPC,通过 1Gb 以太网连接进行管理,并使用一个临时纸板箱作为进气风扇系统。 AI
影响 展示了用于在本地运行 LLM 的定制硬件配置,可能启发有特定硬件需求的用户进行类似的设置。
排序理由 用户构建的用于运行 LLM 的硬件配置。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →