一位开发者为 Qwen 3.5 0.8B 模型创建了一个自定义 C++ 引擎和一种新的 4 位量化格式 H128/Q4-G32-DOT4。这种新格式使模型大小减小到 425 MB,比 Unsloth 的混合精度 Q4_0 小 71 MB。在 Ryzen 9 9955HX3D CPU 上的基准测试显示性能显著提升,自定义引擎的预填充速度最高可达 2.9 倍,批处理 16 的吞吐量比其他引擎高 1.7 倍。 AI
影响 使得在消费级硬件上更高效地本地部署小型语言模型成为可能。
排序理由 针对现有模型的自定义引擎和量化格式。
- 0.8B
- central processing unit
- H128/Q4-G32-DOT4
- ik_llama.cpp
- llama.cpp
- Qwen 3.5
- Ryzen 9 9955HX3D
- Unsloth
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →