Colibri,一个C语言推理引擎,可在消费级硬件上运行高达7440亿参数的大型语言模型。它通过将密集层存储在内存中,并在需要时从NVMe存储流式传输路由专家来实现这一点。虽然这种方法会影响批量推理速度,但它满足了对高级AI模型本地执行的重大需求,Colibri在GitHub上迅速获得星标就证明了这一点。 AI
影响 使大型语言模型能够在消费级硬件上运行,从而可能使更广泛的用户能够获得先进的AI能力。
排序理由 该项目描述了一个推理引擎,它能够在消费级硬件上运行大型模型,这是一项与工具相关的开发,而不是核心前沿发布或研究论文。
在 Mastodon — sigmoid.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →