一款名为 NInfer 的全新推理引擎,使用 C++/CUDA 从头开始构建并已开源,展示了 Qwen3.6-35B-A3B 模型令人印象深刻的性能。该引擎在单张 RTX 5090 GPU 上实现了 65,536 token 全量补全的持续速度 542 token/秒。通过自定义量化、内核融合和其他深度流水线增强实现了这一优化,使得 NInfer 高度专注于特定的 Qwen3.6 检查点。 AI
影响 像 NInfer 这样的优化推理引擎可以显著提高大型语言模型在消费级硬件上的性能和可访问性。
排序理由 该集群描述了一个开源推理引擎的发布及其与特定模型的性能基准测试,属于人工智能基础设施的研究与开发范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →