在 r/LocalLLaMA 子版块的用户正在讨论 Qwen3.8-27B 模型的性能,特别是其 token 输出速度。一位用户报告称,在使用 Qwen3.8-27B-heretic-ara 模型,通过 llama.ccp 进行 Q5_K_M GGUF 量化后,在配备 3090 GPU、64 GB RAM 和 AMD 7950x CPU 的系统上,大约能达到每秒 30-32 个 token。 AI
影响 为本地运行开源模型的用户提供了关于实际性能的见解。
排序理由 Reddit 上关于模型性能的用户讨论。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →