PulseAugur
实时 17:19:33
English(EN) 543 tok/s single-request Qwen3.6-35B-A3B on one RTX 5090 over a 65K-token decode

NInfer 引擎在单张 RTX 5090 上实现 Qwen3.6 542 tok/s

一款名为 NInfer 的全新推理引擎,使用 C++/CUDA 从头开始构建并已开源,展示了 Qwen3.6-35B-A3B 模型令人印象深刻的性能。该引擎在单张 RTX 5090 GPU 上实现了 65,536 token 全量补全的持续速度 542 token/秒。通过自定义量化、内核融合和其他深度流水线增强实现了这一优化,使得 NInfer 高度专注于特定的 Qwen3.6 检查点。 AI

影响NInfer 这样的优化推理引擎可以显著提高大型语言模型在消费级硬件上的性能和可访问性。

排序理由 该集群描述了一个开源推理引擎的发布及其与特定模型的性能基准测试,属于人工智能基础设施的研究与开发范畴。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

NInfer 引擎在单张 RTX 5090 上实现 Qwen3.6 542 tok/s

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/FormOne2615 ·

    单张RTX 5090在65K token解码下,Qwen3.6-35B-A3B单请求吞吐量达543 tok/s

    <!-- SC_OFF --><div class="md"><p><a href="https://reddit.com/link/1v1no8e/video/k5zlxk2ideeh1/player">An example</a></p> <h1>TL;DR</h1> <p>I have open-sourced <a href="https://github.com/Neroued/ninfer">NInfer</a>, a from-scratch C++/CUDA inference engine currently specialized f…