Microsoft 发布了 VibeVoice-ASR-BitNet,这是一款高度压缩的自动语音识别模型,专为在边缘 CPU 上进行实时推理而设计,无需 GPU。该模型在实时因子 (RTF) 低于 1 的情况下,仅使用三个 CPU 线程,与 Whisper.cpp 等现有解决方案相比实现了显著的加速。通过异构量化实现压缩,将模型大小从 4.62 GB 减小到 1.58 GB,同时保持可比的准确性并支持多种语言。 AI
影响 使资源受限的边缘设备能够进行实时语音识别,有可能加速在物联网和移动应用等领域的采用。
排序理由 来自主要科技公司 (Microsoft) 的模型发布,重点关注边缘设备的性能和效率。[lever_c_demoted from frontier_release: ic=2 ai=1.0]
- Arm Holdings
- arXiv
- BITNET
- GGML
- Hugging Face
- variational auto-encoder
- VibeVoice-ASR
- VibeVoice-ASR-BitNet
- x86
- llama.cpp
- llama-cpp-python
- microsoft/VibeVoice-ASR-BitNet
- Ollama
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →