一种名为“Bonsai”的大型语言模型量化新方法已被开发出来,显著减小了模型尺寸,同时保留了高比例的智能。该技术将 27B 类模型压缩至约 5.9 GB,相比 FP16 模型通常的 54 GB 有了大幅缩减。Bonsai 通过使用三元变换器权重,在推理、数学和编码任务等各种基准测试中保持了 98.2% 的 FP16 智能,并支持 262K 令牌上下文窗口的设备端运行。 AI
影响 使得在消费级硬件上运行强大的大型语言模型成为可能,显著降低了本地人工智能开发的门槛。
排序理由 在 GitHub 拉取请求和 Reddit 帖子中描述的大型语言模型新量化方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →