阿里巴巴的Qwen团队发布了Qwen3.8-27B,这是一个开源的小型模型,取得了令人印象深刻的性能指标。该模型在使用NVFP4和DSpark优化的情况下,在单块RTX 5090 GPU上解码速度达到每秒206.1个token。此次发布还包括SGLang的Day-0支持,SGLang是一个促进模型高效执行的项目。 AI
影响 为消费级GPU上的小型模型性能设定了新的基准,可能降低了高级AI应用的入门门槛。
排序理由 前沿实验室模型发布,包含性能指标。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →