对 NInfer C++20/CUDA 推理引擎的一个分叉已被开发出来,以支持 Qwen-3.8 27B 模型 100 万个 token 的上下文窗口。这个增强版本运行在双 5090 GPU 上,与 vLLM 相比,在解码时实现了显著更高的 token/秒速率,尤其是在超出基础模型的原生上下文限制时。虽然 vLLM 提供更快的预填充时间,但 NInfer 分叉在极端上下文长度下展示了改进的内存效率和持续的解码性能。 AI
影响 为本地 LLM 部署实现了显著更大的上下文窗口,可能提高需要广泛上下文的任务的性能。
排序理由 这是现有推理引擎的一个分叉,为特定模型增加了功能,而不是一个新模型发布或基础研究。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →