PulseAugur
实时 06:20:21
English(EN) I pushed Kimi K3 onto one CPU with 8 GB of RAM

Kimi K3 模型通过自定义 C99 引擎在 8GB 内存的 CPU 上运行

一位开发者创建了一个 C99 推理引擎,允许 Kimi K3 模型在单核 CPU 和 8GB RAM 上运行。虽然由于速度慢(在最低 RAM 设置下每 token 约 33 秒)不适用于生产环境,但该引擎旨在帮助理解模型架构。该实现绕过了传统的框架和 GPU,仅依靠 CPU 处理和 NVMe 存储来运行模型的庞大检查点。 AI

影响 展示了在有限硬件上运行大型模型的新颖方法,可能降低了可访问性门槛。

排序理由 现有模型的自定义推理引擎,并非新模型发布或重要研究。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Kimi K3 模型通过自定义 C99 引擎在 8GB 内存的 CPU 上运行

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/FareedKhan557 ·

    我将 Kimi K3 运行在仅有 8GB 内存的单核 CPU 上

    <!-- SC_OFF --><div class="md"><p>I <a href="https://www.hyperstack.cloud/technical-resources/tutorials/deploy-kimi-k3-on-gpu-cloud-for-multi-node-2.8t-inference">deployed K3 on 32 H100s at work</a> a couple of weeks ago and <strong>then got annoyed that there was no way to poke …