一款名为 Nifer 的新推理引擎已发布,据报道在 Qwen 3.6 35B 模型上实现了 550-720 tokens/秒的速度。用户形容这种性能“简直是疯了”,它无需复杂的批处理或并行代理即可实现,并支持 250k tokens 的上下文窗口。该引擎专门针对 RTX 5090 GPU 进行了优化,可在 GitHub 上获取,最初支持 Linux,未来可能支持 Windows。 AI
影响 可能实现大型语言模型显著更快的本地推理。
排序理由 发布了一款针对特定硬件优化的新推理引擎。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →