Reddit 的 r/LocalLLaMA 子版块上一位用户正在就 Qwen3.8-Flash-Next 模型在其 R9700 系统上的性能寻求反馈。他们在使用 230,000 个 token 的上下文长度时,预填充速度为 863 token/s,解码速度为 35 token/s,并且不确定这些速度是否对其硬件配置是最佳的。用户详细介绍了他们的设置,包括具体的模型版本、后端、CPU、RAM、专家卸载、上下文设置以及 ngram 表的使用,并寻求关于潜在调优以提高质量和速度的建议。 AI
影响 提供了关于在消费级硬件上本地 LLM 部署的实际性能限制和调优可能性的见解。
排序理由 用户级别关于在特定硬件上优化本地 LLM 性能的咨询。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →