PulseAugur
中
实时 11:57:26
实体 FreeToken

FreeToken

PulseAugur coverage of FreeToken — every cluster mentioning FreeToken across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
  1. 2026-09-07 product_launch FlashML released FreeToken, an open-source serving engine for running large AI models locally on consumer hardware. 来源
  2. 2026-08-31 research_milestone Researchers developed FreeToken, an open-source inference engine for Mixture-of-Experts models. 来源
  3. 2026-08-24 product_launch A new execution environment named FreeToken was released, designed to run large language models efficiently on low-memory GPUs. 来源
  4. 2026-08-23 product_launch FreeToken, an edge-native MoE serving engine, was released, enabling large models to run on single GPUs. 来源
  5. 2026-08-23 product_launch FreeToken, an open-source engine for running large AI models on consumer hardware, has been released. 来源
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_242330 ·

    FreeToken 引擎可在个人 PC 上运行大型 MoE 模型

    FreeToken 是一个开源引擎,旨在通过将整个 PC 作为异构推理系统来在个人硬件上运行大型混合专家(MoE)模型。它通过将完整的专家池存储在 CPU 主机 RAM 中,同时将非专家权重和共享专家缓存保留在 GPU 中来管理 MoE 模型。该系统动态测量主机内存和 PCIe 带宽,以优化 CPU 和 GPU 之间的专家执行,并采用双缓冲来隐藏预填充期间的传输延迟。此外,FreeToken 还为代理工作负载提供语义感知缓存,允许它在…

  2. TOOL · CL_240540 ·

    FreeToken 可在游戏 PC 上本地运行大型 AI 模型

    FlashML 团队发布了 FreeToken,这是一个开源服务引擎,旨在高效地在消费级硬件上运行大型专家混合(MoE)AI 模型。该工具统一了 GPU 和 CPU 等异构资源,以实现海量模型的本地高速执行,无需昂贵的云服务。FreeToken 利用带宽自适应协同执行和语义感知缓存等高级优化来提高效率并赋能 AI 代理开发。

  3. TOOL · CL_226828 ·

    FreeToken增强了MoE模型在消费级硬件上的性能

    来自加州大学伯克利分校和麻省理工学院的研究人员推出了FreeToken,一个旨在提高混合专家(MoE)模型性能的开源推理引擎。该新引擎专门针对在消费级硬件上运行这些复杂模型进行了优化,使先进的AI更加易于获取。

  4. TOOL · CL_223979 ·

    FreeToken 以新的 MoE 服务引擎挑战 Ollama 和 llama.cpp

    FreeToken 是一款新发布的混合专家(MoE)模型服务引擎,并已与 Ollama 和 llama.cpp 等现有工具进行了比较。与在加载时将模型权重在 GPU 和 CPU 之间分割的 Ollama 和 llama.cpp 不同,FreeToken 采用了一种动态方法。它将所有专家保留在 CPU RAM 中,并将 GPU 的剩余内存用作最近使用专家的 LRU 缓存,根据实时带宽测量结果智能地决定是通过 PCIe 加载权重还是在 C…

  5. TOOL · CL_216259 ·

    FreeToken环境可在8GB GPU上运行35B MoE模型

    一种名为FreeToken的新运行环境已被开发出来,旨在使大型语言模型(特别是350亿参数模型)能够在仅具有8GB显存的GPU上高效运行。该环境针对专家混合(MoE)模型进行了优化,这类模型以处理大量参数的效率而闻名。

  6. RESEARCH · CL_214993 ·

    FreeToken使大型AI模型能在消费级GPU上运行 · 已追踪4个来源

    FreeToken是加州大学伯克利分校开发的一款开源引擎,它允许像拥有7530亿参数的GLM-5.2这样的大型专家混合(MoE)模型在消费级硬件上运行。它通过将个人计算机视为一个统一的弹性推理平台,动态地将计算映射到GPU、CPU和内存上,从而实现这一点。这项创新为在边缘部署前沿规模的AI模型开辟了新的可能性。

  7. RESEARCH · CL_215002 ·

    FreeToken 使大型 MoE 模型能在单 GPU 上运行

    来自加州大学伯克利分校和德克萨斯大学奥斯汀分校的研究人员开发了 FreeToken,这是一个开源服务引擎,旨在单台工作站 GPU 上运行大型 MoE 模型,显著降低了先进 AI 的硬件门槛。该系统通过采用带宽自适应执行和语义感知缓存来有效管理 CPU 和 GPU 之间的计算,从而解决了现有引擎的局限性。FreeToken 使 753B GLM-5.2 等模型能在消费级硬件上以交互速度运行,使强大的人工智能能力对个人开发者和小团队更加易于获取。

  8. TOOL · CL_208191 ·

    FreeToken 系统使大型 MoE 模型能在个人设备上运行

    一个名为 FreeToken 的新服务系统已被开发出来,以支持大型专家混合(MoE)模型在个人设备上的高效运行。该系统动态适应异构本地硬件,优化计算和模型状态,以持续映射到可用资源。FreeToken 支持广泛的 MoE 模型和代理工作负载,允许在消费级硬件上部署明显更大的模型,例如在单个工作站 GPU 上运行 753B 模型。