一项技术比较重点介绍了两个设备端 LLM 推理引擎 NobodyWho 和 Cactus,详细说明了它们在引擎设计、模型格式、硬件加速和许可方面的差异。NobodyWho 利用 llama.cpp 并直接支持现有的 GGUF 模型格式,提供广泛的兼容性。Cactus 采用专有的量化格式 (CQ) 和自己的引擎,针对具有特定 ARM NEON SIMD 和 Metal 支持的移动处理器进行了优化,但计划支持 NPU。虽然 NobodyWho 集成了各种平台包管理器以便于安装,但 Cactus 需要克隆仓库并进行构建过程,尽管它也提供特定平台的软件包。两个引擎都支持聊天以外的功能,例如工具调用和嵌入,并采用不同的实现方法。 AI
影响 为开发人员提供技术比较,以便根据特定的硬件和许可需求在两个设备端 LLM 推理引擎之间进行选择。
排序理由 对两个特定的设备端 LLM 推理引擎进行比较。
- Apple GPUs
- Apple Neural Engine
- ARM NEON SIMD
- Cactus
- Cactus Quants
- Exynos
- GGUF
- Hugging Face
- llama.cpp
- MediaTek
- Metal
- NobodyWho
- OpenAI
- Qualcomm
- Vulkan
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →