POCKET 是一款新的设备端 LLM,旨在无需 GPU 即可在标准 CPU 上运行 35B 参数模型,利用 llama.cpp 推理栈。此方法旨在克服本地和边缘部署中 GPU 稀缺和成本的障碍。虽然其吞吐量约为设备端基线 Bonsai 的 3.4 倍,但其性能和输出质量,尤其是在韩语生成方面,在很大程度上取决于量化级别,建议使用 Q4 或更高版本以获得可用结果。 AI
影响 使在消费级硬件上运行更大的 LLM 成为可能,可能提高设备端 AI 应用的隐私性和可访问性。
排序理由 在消费级硬件上运行 LLM 的新产品发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →