一种新的模型架构 Qwen 3.8 Flash Next,已展示出在单张 RTX 4090 GPU 上以大约每秒 100 个 token 的速度运行的能力。这是通过采用稀疏的专家混合(MoE)设计实现的,其中每个 token 只激活模型参数的一小部分。该系统名为 Strata,将不常用的参数卸载到系统内存,并利用 NVMe SSD 进行 n-gram 表,从而显著降低了显存需求。然而,要达到这些速度需要大量的系统内存,实际上是在消费级 GPU 之外还需要工作站级别的内存。 AI
影响 这一发展突显了在消费级硬件上运行大型模型的创新技术,有可能降低高级 AI 应用的入门门槛。
排序理由 该项目讨论了一种新颖的模型架构及其在消费级硬件上的性能,这是一个面向研究的主题。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →