PulseAugur
实时 10:34:57
English(EN) VibeVoice-ASR-BitNet Technical Report

VibeVoice-ASR-BitNet 在边缘 CPU 上实现实时语音识别

研究人员开发了 VibeVoice-ASR-BitNet,这是 VibeVoice-ASR 模型的一个高度压缩版本,专为在边缘 CPU 上实现实时性能而设计。该新模型采用了激进的量化技术,包括用于 VAE 声学分词器的 INT8 和用于语言模型的 ternary 权重,以实现显著的加速。通过在 ggml 框架内使用自定义 SIMD 内核和融合算子进行优化,VibeVoice-ASR-BitNet 能够使用最少的 CPU 线程执行实时语音识别,并且在模型大小相当的情况下,其速度明显快于之前的版本,而准确率仅略有下降。 AI

影响 在资源受限的边缘设备上实现实时语音识别,可能扩展 AI 在移动和物联网领域的应用。

排序理由 该集群包含一份技术报告,详细介绍了新的模型变体及其性能优化。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

VibeVoice-ASR-BitNet 在边缘 CPU 上实现实时语音识别

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Jianwei Yu, Li Dong, Furu Wei ·

    VibeVoice-ASR-BitNet 技术报告

    arXiv:2607.21075v1 Announce Type: cross Abstract: We present VibeVoice-ASR-BitNet, a compressed variant of VibeVoice-ASR optimized for real-time inference on edge CPUs. We apply heterogeneous quantization tailored to the computational characteristics of each stage: the VAE acoust…