PulseAugur
实时 04:15:13
English(EN) GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.

新的 C 推理引擎 WASTE 支持在有限 RAM 上运行 2.78T 参数 Kimi k3 模型

一个名为 WASTE 的新的基于 C 的推理引擎已被开发出来,用于运行大型语言模型,特别是 2.78 万亿参数的 Kimi k3 模型,通过直接从 NVMe 存储流式传输激活的权重。这种方法允许模型通过利用磁盘作为扩展内存来运行超出可用 RAM 的限制。该引擎被设计为无依赖且可嵌入的,将核心模型保留在内存中,同时有效地管理来自磁盘的专家权重。 AI

影响 使得在 RAM 有限的硬件上运行极大型模型成为可能,从而可能使先进的 AI 功能的访问民主化。

排序理由 该集群描述了一个用于运行现有模型的新软件工具(推理引擎),而不是一个新的模型发布或研究突破。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 C 推理引擎 WASTE 支持在有限 RAM 上运行 2.78T 参数 Kimi k3 模型

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/ab2377 ·

    GitHub - sqliteai/waste: 通过直接从 NVMe 流式传输激活的权重,在可用 RAM 之外运行完整的 2.78 万亿参数 Kimi K3 模型。一个无依赖、可嵌入的 C 推理引擎。

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vdy1nd/github_sqliteaiwaste_run_the_full/"> <img alt="GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A depe…