PulseAugur
实时 12:02:01

FreeToken 使大型 MoE 模型能在单台工作站 GPU 上运行

来自加州大学伯克利分校和德克萨斯大学奥斯汀分校的研究人员开发了 FreeToken,这是一个原生于边缘的混合专家(MoE)服务引擎,旨在单台工作站 GPU 上运行大型语言模型。该系统通过将个人机器视为统一的推理平台,解决了在消费级硬件上部署 GLM-5.2(753B 参数)等强大模型的挑战。FreeToken 优化了可用 GPU、CPU 和内存资源之间的计算和模型状态映射,使得通常需要数据中心级基础设施的模型能够实现交互式速度。该引擎是开源的,可用于本地部署,使先进的 AI 功能对个人开发者和小型团队更加可用,尤其是在医疗和法律等数据隐私至关重要的敏感行业。 AI

影响 使大型 MoE 模型能够部署在消费级硬件上,可能降低开发者和小型团队的成本。

排序理由 文章描述了一个新的服务引擎,该引擎使现有模型能够在消费级硬件上运行,而不是发布新模型或基础研究突破。

在 MarkTechPost 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

FreeToken 使大型 MoE 模型能在单台工作站 GPU 上运行

报道来源 [1]

  1. MarkTechPost TIER_1 English(EN) · Asif Razzaq ·

    认识 FreeToken:一款可在单台工作站 GPU 上运行 753B GLM-5.2 的原生边缘 MoE 服务引擎

    <p>FreeToken splits MoE cache misses between PCIe fills and CPU execution using measured bandwidths, unlocking frontier models locally</p> <p>The post <a href="https://www.marktechpost.com/2026/08/23/meet-freetoken-an-edge-native-moe-serving-engine-that-runs-753b-glm-5-2-on-a-sin…