ExVRAM Lab 的研究人员已成功在 8GB NVIDIA RTX 5060 GPU 上完全运行 Qwen3.8–27B 语言模型,实现了约每秒 30 个 token 的生成速度。这是通过利用超低比特量化和现有的开源推理技术实现的,他们称之为“Exchange Compute for VRAM”。该项目旨在通过牺牲部分计算能力来换取更紧凑的权重表示,从而确定在具有有限 VRAM 的消费级 GPU 上运行大型本地 LLM 的可行性。 AI
影响 展示了在消费级硬件上运行更大 LLM 的潜力,降低了本地 AI 部署的门槛。
排序理由 演示在有限硬件上运行 LLM 新颖技术的研究项目。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →