Reddit的r/LocalLLaMA子版块上一位用户分享了在消费级硬件上运行大型语言模型的令人印象深刻的基准测试。他们使用Nvidia RTX 4090和RTX 5060 Ti,并将部分层卸载到64GB系统内存,在350亿参数模型(35b a3b)上实现了每秒206个token。更值得注意的是,在类似条件下,一个1220亿参数模型(barium-122)的运行速度达到了每秒37个token,超出了用户的乐观预期。 AI
影响 展示了在消费级硬件上运行大型语言模型的重大进展,可能降低AI实验的门槛。
排序理由 用户生成的消费级硬件运行LLM的基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →