VibeVoice-ASR
PulseAugur coverage of VibeVoice-ASR — every cluster mentioning VibeVoice-ASR across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
HINTT 比较级联与统一语音大模型在说话人归属 ASR 中的应用
HINTT 的研究人员向第二届 MLC-SLM 挑战赛提交了一个系统,该系统比较了两种用于说话人归属自动语音识别 (ASR) 的方法。该研究调查了一种级联流程,该流程结合了独立的说话人分离和 ASR 模型,以及一种直接生成说话人标签、时间戳和转录的统一语音大模型。HINTT 团队的最终提交采用了级联方法,集成了 DiariZen 进行说话人分离,Qwen3-ASR 进行转录,并使用大模型进行错误校正。为了进行比较分析,VibeVoic…
-
Microsoft 发布 VibeVoice-ASR-Streaming 用于实时语音识别
Microsoft 发布了 VibeVoice-ASR-Streaming,这是一种新颖的基于 LLM 的端到端模型,用于实时、说话人归属的语音识别。该系统统一了自动语音识别 (ASR) 和说话人分割,解决了先前统一模型的延迟问题。VibeVoice-ASR-Streaming 模型以小前瞻处理音频块,从而在语音到达时立即输出“谁说了什么”。Microsoft 已公开了 1.5B 和 7B 模型权重。
-
Microsoft 发布 VibeVoice-ASR-BitNet 以实现实时 CPU 推理
Microsoft 发布了 VibeVoice-ASR-BitNet,这是一款高度压缩的自动语音识别模型,专为在边缘 CPU 上进行实时推理而设计,无需 GPU。该模型在实时因子 (RTF) 低于 1 的情况下,仅使用三个 CPU 线程,与 Whisper.cpp 等现有解决方案相比实现了显著的加速。通过异构量化实现压缩,将模型大小从 4.62 GB 减小到 1.58 GB,同时保持可比的准确性并支持多种语言。