一个名为 AirLLM 的新开源项目已发布,它使得大型语言模型能够在消费级 GPU 上运行,同时显著降低显存需求。通过采用逐层推理技术,AirLLM 只将当前正在执行的 Transformer 层加载到显存中,从而大大减少了内存需求。这使得像 70B 参数模型可以在 4GB 显存上运行,405B 模型可以在 8GB 上运行,甚至 2.8 万亿参数的 Kimi K3 只需要 3.7GB。 AI
影响 通过大幅降低推理的硬件要求,实现大型语言模型的普及化访问。
排序理由 开源项目发布,支持在消费级硬件上高效进行 LLM 推理。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →