一位 Reddit 用户报告了 Qwen3.8-Flash-Next 模型在功耗受限的配置下取得了令人印象深刻的性能指标。使用 Strata 软件,在配备 96GB DDR5 内存的 5090 GPU 上,系统实现了 150-200 tokens/秒 的解码速度和 5-6k tokens 的预填速度。该配置还支持 128k tokens 的上下文窗口,量化级别为 IQ3_S。 AI
影响 展示了大型语言模型的高效本地部署,可能降低高级人工智能使用的门槛。
排序理由 用户关于特定模型和软件配置在本地硬件上性能的报告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →