PulseAugur
实时 09:43:42
English(EN) Weight-Aware Streaming Tensor Engine: run Kimi K3 using 29 GB of RAM at 0.50 tok/s

新引擎使 Kimi K3 LLM 可以在 29GB 内存上运行

一个名为 Weight-Aware Streaming Tensor Engine (WASTE) 的新引擎已被开发出来,旨在使 Kimi K3 大型语言模型能够在消费级硬件上运行。该引擎允许 Kimi K3 以低至 29 GB 的内存运行,处理速度达到每秒 0.50 个 token。该项目旨在通过优化资源需求来提高先进 LLM 的可访问性。 AI

影响 使 Kimi K3 等先进 LLM 能够在消费级硬件上运行,可能增加可访问性和本地部署选项。

排序理由 该条目描述了一项技术开发(一个新引擎),用于在消费级硬件上运行现有 LLM,这属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新引擎使 Kimi K3 LLM 可以在 29GB 内存上运行

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/galapag0 ·

    Weight-Aware Streaming Tensor Engine: run Kimi K3 using 29 GB of RAM at 0.50 tok/s

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vche00/weightaware_streaming_tensor_engine_run_kimi_k3/"> <img alt="Weight-Aware Streaming Tensor Engine: run Kimi K3 using 29 GB of RAM at 0.50 tok/s" src="https://external-preview.redd.it/LO7Jq0cjBO3v9YrNjC…