一款名为 Colibri 的新推理引擎允许用户在标准台式机硬件上运行超大型混合专家(MoE)模型,例如拥有 7440 亿参数的模型。Colibri 并非通过压缩模型来使其适应显存(VRAM),而是采用一种类似于权重即时(JIT)编译器的“放置”策略。模型的密集组件驻留在内存(RAM)中,而大量的专家则根据需要从快速的 NVMe 磁盘存储中流式传输。这种方法能够以每秒一到两个 token 的速率执行海量模型,使其适用于批量分析或注重隐私的任务,但不适合交互式聊天。 AI
影响 使得在消费级硬件上运行非常大的 LLM 成为可能,从而在特定用例(如批量处理)中可能实现更广泛的访问。
排序理由 该条目描述了一种新的推理引擎,它使得在消费级硬件上运行大型模型成为可能,这是一项与工具相关的开发,而非前沿模型发布或研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →