一位用户已成功配置了一组四块 AMD BC-250 挖矿板,用于在本地运行大型语言模型。该设置成本约为 500 美元,实现了令人印象深刻的性能指标,Next Flash IQ3_XXS 在 100k 上下文窗口下可达 70 token/秒,Qwen 3.6 35B A3B IQ4 模型在 256k 上下文下可运行至 145 token/秒。用户详细介绍了对系统进行的优化,包括推测解码、图重放和高效上下文处理,并指出了系统的功耗和热节流挑战。 AI
影响 展示了在本地运行大型语言模型的经济高效的硬件解决方案。
排序理由 用户驱动的挖矿硬件重新用于 LLM 推理。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →