FreeToken 是一款新发布的混合专家(MoE)模型服务引擎,并已与 Ollama 和 llama.cpp 等现有工具进行了比较。与在加载时将模型权重在 GPU 和 CPU 之间分割的 Ollama 和 llama.cpp 不同,FreeToken 采用了一种动态方法。它将所有专家保留在 CPU RAM 中,并将 GPU 的剩余内存用作最近使用专家的 LRU 缓存,根据实时带宽测量结果智能地决定是通过 PCIe 加载权重还是在 CPU 上进行计算。 AI
影响 为 MoE 模型引入了一种新颖的服务引擎,可能在资源受限的硬件上提供性能改进。
排序理由 模型服务的新软件工具发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →