PulseAugur
实时 04:49:02
English(EN) 600tok/s single request on qwen3.6 35ba3b with Ninfer on an RTX Pro 6000. Anybody remember that Comcast ad "stupid fast"?

qwen3.6 35ba3b 模型在 RTX Pro 6000 上达到 600 tokens/sec

Reddit r/LocalLLaMA 子版块的一位用户报告称,在使用 qwen3.6 35ba3b 模型进行单请求时,达到了每秒 600 个 token 的速度。这一性能是在 Nvidia RTX Pro 6000 工作站上使用 NInfer 框架实现的。用户将该模型描述为一个有能力的选项,尽管不是顶级模型,但适用于信息检索和代码生成等任务,并指出其速度使其即使对于更多 token 密集型操作也具有可行性。 AI

影响 展示了高端硬件上本地 LLM 推理速度的显著提升。

排序理由 用户关于特定模型硬件/软件性能的报告。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

qwen3.6 35ba3b 模型在 RTX Pro 6000 上达到 600 tokens/sec

本文如何被排名

Signal score
3 / 100
Composite score across the factors below. Higher = stronger signal that this story matters right now.
Newsworthiness bucket
Tool
用户关于特定模型硬件/软件性能的报告。
Source corroboration
Single-source cluster
Only one publisher covered this so far. Single-source stories can still rank when the publisher is high-authority, but they lack cross-source corroboration.
Topics
infra
Editorial topic classification. Feeds into how the story surfaces on /topic/<slug> hub pages and into the per-entity coverage mix.
AI-industry relevance
High
Clearly on-topic for AI-industry coverage.
Story freshness
Breaking (< 6h)
Fresh story with cross-source coverage still developing. Ranking may shift as more sources report.

完整方法见我们的编辑标准

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/CharlesStross ·

    qwen3.6 35ba3b 在 RTX Pro 6000 上通过 Ninfer 实现单请求 600tok/s。有人还记得 Comcast 的广告“快得离谱”吗?

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1wja9ml/600toks_single_request_on_qwen36_35ba3b_with/"> <img alt="600tok/s single request on qwen3.6 35ba3b with Ninfer on an RTX Pro 6000. Anybody remember that Comcast ad &quot;stupid fast&quot;?" src="https…