一个名为AirLLM的新开源项目,使用户能够在内存仅为4GB的消费级GPU上运行参数高达700亿的大型语言模型。这是通过将模型的各个层流式传输到GPU进行计算来实现的,而不是要求整个模型都装入内存。这种方法允许在不进行量化或蒸馏的情况下进行全精度推理,从而使强大的模型能够在标准硬件上进行本地研究和私有数据处理。 AI
影响 降低了在本地运行大型模型的硬件门槛,促进了更广泛的研究和私有数据推理。
排序理由 开源项目发布,为现有模型带来了新的硬件能力。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →