一位Reddit用户正在探索一种在没有GPU的情况下,在CPU上运行大型语言模型的新方法,目标是使一个拥有100亿参数的模型达到每秒100个token的解码速度。核心思想是,CPU解码速度取决于每个token的活跃参数,而不是总参数,这表明具有细粒度混合专家(MoE)和三元权重(ternary weights)的架构可以在不牺牲速度的情况下扩展模型容量。对一个较小模型的初步测试表明,在优化活跃参数时,每秒token数显著增加。 AI
影响 这种方法有可能在消费级硬件上运行更大的语言模型,从而扩大AI开发和部署的可及性。
排序理由 该条目讨论的是在特定硬件(CPU)上优化LLM性能的技术方法,而不是新的模型发布或重大的行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →