Reddit 的 r/LocalLLaMA 子版块上一位用户分享了他的设置,该设置涉及在网络附加存储 (NAS) 设备中运行两块 NVIDIA RTX A3000M 和 A2000M GPU。该配置在使用 Qwen3.8-27B-GSQ-RCO-IQ3_S 模型时,实现了每秒 20 个 token 的速度,并使用了 163k 的上下文窗口。 AI
影响 展示了在本地运行大型语言模型的用户级设置,展示了特定硬件和模型组合的性能指标。
排序理由 用户生成的内容,详细介绍了运行大型语言模型的硬件配置和性能。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →