PulseAugur
实时 17:07:25
English(EN) Yes, we are back👑, with 206 tok/s on a single RTX 5090!

阿里巴巴的Qwen3.8-27B模型在RTX 5090上达到206 tok/s

阿里巴巴的Qwen团队发布了Qwen3.8-27B,这是一个开源的小型模型,取得了令人印象深刻的性能指标。该模型在使用NVFP4和DSpark优化的情况下,在单块RTX 5090 GPU上解码速度达到每秒206.1个token。此次发布还包括SGLang的Day-0支持,SGLang是一个促进模型高效执行的项目。 AI

影响 为消费级GPU上的小型模型性能设定了新的基准,可能降低了高级AI应用的入门门槛。

排序理由 前沿实验室模型发布,包含性能指标。[lever_c_demoted from frontier_release: ic=1 ai=1.0]

在 X — Qwen (Alibaba) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

阿里巴巴的Qwen3.8-27B模型在RTX 5090上达到206 tok/s

报道来源 [1]

  1. X — Qwen (Alibaba) TIER_1 English(EN) · Alibaba_Qwen ·

    是的,我们回来了👑,在单块RTX 5090上实现了206 tok/s!

    Yes, we are back👑, with 206 tok/s on a single RTX 5090! Amazing Day-0 work from the SGLang team. Give it a try~@sgl_project