一个名为 Weight-Aware Streaming Tensor Engine (WASTE) 的新引擎已被开发出来,旨在使 Kimi K3 大型语言模型能够在消费级硬件上运行。该引擎允许 Kimi K3 以低至 29 GB 的内存运行,处理速度达到每秒 0.50 个 token。该项目旨在通过优化资源需求来提高先进 LLM 的可访问性。 AI
影响 使 Kimi K3 等先进 LLM 能够在消费级硬件上运行,可能增加可访问性和本地部署选项。
排序理由 该条目描述了一项技术开发(一个新引擎),用于在消费级硬件上运行现有 LLM,这属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →