研究人员开发了 VibeVoice-ASR-BitNet,这是 VibeVoice-ASR 模型的一个高度压缩版本,专为在边缘 CPU 上实现实时性能而设计。该新模型采用了激进的量化技术,包括用于 VAE 声学分词器的 INT8 和用于语言模型的 ternary 权重,以实现显著的加速。通过在 ggml 框架内使用自定义 SIMD 内核和融合算子进行优化,VibeVoice-ASR-BitNet 能够使用最少的 CPU 线程执行实时语音识别,并且在模型大小相当的情况下,其速度明显快于之前的版本,而准确率仅略有下降。 AI
影响 在资源受限的边缘设备上实现实时语音识别,可能扩展 AI 在移动和物联网领域的应用。
排序理由 该集群包含一份技术报告,详细介绍了新的模型变体及其性能优化。[lever_c_demoted from research: ic=1 ai=1.0]
- Arm Holdings
- arXiv
- BITNET
- ggml
- Hugging Face
- variational auto-encoder
- VibeVoice-ASR
- VibeVoice-ASR-BitNet
- x86
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →