一位用户使用 INT4 量化技术,在现场可编程门阵列 (FPGA) 上实现了 Qwen 3.5 大型语言模型。该项目利用相对廉价的 eBay 挖矿硬件,特别是 SQRL FK33 和 Jungle Cat 板卡,来实现 LLM 推理。对 Qwen 3.5 9B 模型的初步测试表明,在 75MHz 下的推理速度约为 2 tokens/秒,并预计 27B 模型在多卡设置和优化 RTL 下将实现显著更高的性能。 AI
影响 展示了 LLM 的新颖硬件实现方式,有可能实现更易于访问且成本效益更高的推理解决方案。
排序理由 用户在 FPGA 硬件上实现了 LLM,并非来自主要实验室的前沿发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →