一种新方法允许一个拥有 1800 亿参数的模型 POCKET-Darwin-180B-GGUF 在没有专用 GPU 的消费级硬件上运行。这是通过模型的稀疏专家混合架构(每个 token 只激活其一部分参数)和选择性的 4 位量化过程(保留关键权重的准确性)相结合实现的。量化后的模型以 GGUF 格式提供,需要显著更少的存储和内存,使其能够在具有至少 8GB VRAM 的笔记本电脑上运行,甚至在具有足够 RAM 的迷你 PC 上运行,同时在 MMLU-Pro 等基准测试中保持可比的性能。 AI
影响 使大型语言模型能够在消费级硬件上运行,从而普及访问并减少对云基础设施的依赖。
排序理由 技术性帖子,详细介绍了在消费级硬件上运行大型模型的方法,包括准确性指标和复现步骤。[lever_c_demoted from research: ic=1 ai=1.0]
- Darwin-180B-RSI
- GGUF
- Hugging Face
- llama.cpp
- MMLU-Pro
- modelscope
- POCKET-Darwin-180B-GGUF
- RTX 5060 Laptop
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →