名为 POCKET-Darwin-180B-GGUF 的 Darwin-180B-RSI 模型的量化版本已发布,使其无需专用 GPU 即可在消费级硬件上运行。这个 111 GB 的模型采用了专家混合(MoE)架构,这意味着其 1800 亿参数中只有一小部分在每个 token 生成时处于激活状态。该模型在具有足够 RAM 的 CPU 上可以达到每秒 21 个 token 的速度,或者在 RAM 较少的笔记本电脑上通过利用 SSD 加载权重来获得较慢的速度,同时保持原始模型的精度。 AI
影响 使得在消费级硬件上运行大型语言模型成为可能,减少了对云 GPU 的依赖。
排序理由 发布了用于本地推理的量化、开源模型。
- Darwin-180B-RSI
- FINAL-Bench
- GGUF
- Hugging Face
- llama.cpp
- MMLU-Pro
- POCKET-Darwin-180B-GGUF
- RTX 5060
- VIDRAFT
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →