一位 Reddit 用户正在寻求关于在 Windows 10 系统上使用双 RTX 3090 GPU 本地运行 Qwen3.8-27B 模型性能的建议。他们遇到的 token 生成速度为 50-65 tokens/秒,并对他们的设置(包括 80GB RAM 和特定的 llama.cpp 构建)是否正常表示疑问。用户提供了有关其硬件、软件配置以及运行模型的确切命令的详细信息,希望获得有关潜在优化或故障排除步骤的指导。 AI
影响 为拥有高端消费级硬件的用户提供了对本地 LLM 部署挑战和性能期望的见解。
排序理由 用户生成内容,寻求关于在本地运行 LLM 的特定硬件和软件配置的帮助。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →