来自加州大学伯克利分校和德克萨斯大学奥斯汀分校的研究人员开发了 FreeToken,这是一个开源服务引擎,旨在单台工作站 GPU 上运行大型 MoE 模型,显著降低了先进 AI 的硬件门槛。该系统通过采用带宽自适应执行和语义感知缓存来有效管理 CPU 和 GPU 之间的计算,从而解决了现有引擎的局限性。FreeToken 使 753B GLM-5.2 等模型能在消费级硬件上以交互速度运行,使强大的人工智能能力对个人开发者和小团队更加易于获取。 AI
影响 降低了运行大型前沿模型所需的硬件要求,可能为个人开发者和小团队普及了访问权限。
排序理由 该集群描述了学术研究人员开发的一种用于大型语言模型的新服务引擎,详细介绍了其技术机制和性能。
- Anthropic
- DeepSeek-V4 Flash
- FreeToken
- GLM-5.2
- Kimi k3
- Linux
- llama.cpp
- Microsoft Windows
- NVIDIA
- Ollama
- OpenAI
- University of California, Berkeley
- University of Texas at Austin
- Claude Code
- KTransformers
- MoE-Infinity
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →