NInfer 推出了适用于 Windows 的新版本推理引擎,该版本针对 RTX 4090 显卡进行了优化。此版本允许用户运行 Qwen 3.8 27B 模型,性能范围在每秒 60-100 个 token 之间。根据具体配置,该引擎支持高达 100-150K token 的上下文长度。 AI
影响 使得在消费级硬件上本地运行大型语言模型成为可能,提高了开发者和研究人员的可访问性。
排序理由 这是一个针对现有硬件和模型的软件移植和优化,并非新的模型发布或研究突破。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →