用户正在尝试在消费级硬件上运行 Gemma 和 Qwen 等大型语言模型。一位用户报告称,在配备 NVIDIA 4070 的联想电脑上,Gemma4:12b-it-qat 的运行速度达到了每秒 70 个 token,而 Qwen3.8:27b 的运行速度较慢,为每秒 6 个 token。另一位用户讽刺地指出 Qwen3.8 在高端 GPU 上的性能为每秒 37 个 token,质疑此类实验的实际价值。 AI
影响 展示了在消费级硬件上运行大型语言模型的可及性日益提高,从而能够进行更广泛的实验。
排序理由 用户在消费级硬件上对开源大语言模型进行基准测试和实验。
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →