FreeToken 是一个开源引擎,旨在通过将整个 PC 作为异构推理系统来在个人硬件上运行大型混合专家(MoE)模型。它通过将完整的专家池存储在 CPU 主机 RAM 中,同时将非专家权重和共享专家缓存保留在 GPU 中来管理 MoE 模型。该系统动态测量主机内存和 PCIe 带宽,以优化 CPU 和 GPU 之间的专家执行,并采用双缓冲来隐藏预填充期间的传输延迟。此外,FreeToken 还为代理工作负载提供语义感知缓存,允许它在上下文修改后从锚点检查点恢复,并提供弹性 VRAM 管理以适应不断变化的内存预算。 AI
影响 使在消费级硬件上运行大型 MoE 模型成为可能,从而可能使先进的 AI 功能的访问民主化。
排序理由 该项目描述了一个用于个人硬件上 MoE 模型的开源服务引擎,这是一个软件工具,而不是前沿模型发布或重大的行业事件。
- central processing unit
- DeepSeek-V4 Flash
- FreeToken
- graphics processing unit
- host RAM
- mixture of experts
- PCI Express
- Qwen3.6 35B-A3B
- RTX 4060 Laptop
- RTX 5090
- VRAM
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →