PulseAugur
EN
LIVE 03:20:13

New C inference engine WASTE enables 2.78T parameter Kimi k3 model on limited RAM

A new C-based inference engine called WASTE has been developed to run large language models, specifically the 2.78 trillion parameter Kimi k3 model, by streaming activated weights directly from NVMe storage. This approach allows the model to operate beyond available RAM by utilizing disk as an extended memory. The engine is designed to be dependency-free and embeddable, keeping the core model in memory while efficiently managing expert weights from disk. AI

IMPACT Enables running extremely large models on hardware with limited RAM, potentially democratizing access to advanced AI capabilities.

RANK_REASON The cluster describes a new software tool (inference engine) for running existing models, not a new model release or research breakthrough.

Read on r/LocalLLaMA →

AI-generated summary · Google Gemini · from 1 sources. How we write summaries →

New C inference engine WASTE enables 2.78T parameter Kimi k3 model on limited RAM

COVERAGE [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/ab2377 ·

    GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A dependency-free, embeddable C inference engine.

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vdy1nd/github_sqliteaiwaste_run_the_full/"> <img alt="GitHub - sqliteai/waste: Run the full 2.78-trillion-parameter Kimi K3 model beyond available RAM by streaming activated weights directly from NVMe. A depe…