Reddit r/LocalLLaMA 子版块的一位用户报告称,在使用 qwen3.6 35ba3b 模型进行单请求时,达到了每秒 600 个 token 的速度。这一性能是在 Nvidia RTX Pro 6000 工作站上使用 NInfer 框架实现的。用户将该模型描述为一个有能力的选项,尽管不是顶级模型,但适用于信息检索和代码生成等任务,并指出其速度使其即使对于更多 token 密集型操作也具有可行性。 AI
影响 展示了高端硬件上本地 LLM 推理速度的显著提升。
排序理由 用户关于特定模型硬件/软件性能的报告。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →