一位用户更新了他们 fork 的 NInfer(一个用于在本地运行大型语言模型的工具),以支持 Qwen 3.8-27B 模型。此次更新允许在单个 RTX 4090 GPU 上实现高达 250-350K token 的上下文窗口,而无需系统 RAM。这些优化还使得某些工作负载的生成速度达到每秒 80-160 token。 AI
影响 为本地 LLM 部署实现更大的上下文窗口,可能提高复杂任务的性能。
排序理由 用户开发的软件更新,用于在消费级硬件上运行现有模型。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →