一位开发者的实验表明,AMD APU 上的 DDR5 带宽严重限制了同时运行多个大型语言模型(LLM)的性能。尽管像 Qwen 3.6:35B 这样拥有 350 亿参数的模型,在每个 token 上似乎只使用了其参数的一小部分,但其实际推理速度受到共享内存带宽的限制,使其性能与较小模型相当。这一发现导致在尝试在同一硬件上并发运行两个模型时,由于性能下降而放弃了多模型代理架构。 AI
影响 突出了在消费级硬件上运行多个 LLM 的关键硬件瓶颈,影响了代理架构。
排序理由 开发者的基准测试和对 LLM 推理硬件限制的分析。[lever_c_demoted from research: ic=1 ai=0.7]
- AMD Radeon 780M
- AMD Ryzen 9 7940HS
- DDR5
- Gemma 4:2B-abliterated
- LLM
- Minisforum UM790Pro
- Ollama
- Qwen 2.5:1.5B
- Qwen 3:4B-instruct
- Qwen 3.6:35B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →