一位软件工程师开发了 Ninfer 4080,这是一个旨在 RTX 4080 显卡(16GB 内存)上运行 ISTA-DASLab-Qwen-3.8-27B-GSQ 模型的系统。该新系统旨在显著提高预填充和 token 生成速度,在 100k 上下文长度下,预填充速度最高可达 2720 token/秒,生成速度可达 262 token/秒。该项目已在 GitHub 上分享,利用了 DFlash2 推测解码,并旨在优化硬件利用率,超越通用推理引擎。 AI
影响 使得在消费级硬件上运行更大上下文的模型成为可能,从而可能降低高级 LLM 实验的门槛。
排序理由 这是一个用户开发的工具,用于在特定硬件上运行现有模型,而不是来自前沿实验室的发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →