PulseAugur
中
实时 10:47:04
实体 VibeVoice-ASR

VibeVoice-ASR

PulseAugur coverage of VibeVoice-ASR — every cluster mentioning VibeVoice-ASR across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_284562 ·

    HINTT 比较级联与统一语音大模型在说话人归属 ASR 中的应用

    HINTT 的研究人员向第二届 MLC-SLM 挑战赛提交了一个系统,该系统比较了两种用于说话人归属自动语音识别 (ASR) 的方法。该研究调查了一种级联流程,该流程结合了独立的说话人分离和 ASR 模型,以及一种直接生成说话人标签、时间戳和转录的统一语音大模型。HINTT 团队的最终提交采用了级联方法,集成了 DiariZen 进行说话人分离,Qwen3-ASR 进行转录,并使用大模型进行错误校正。为了进行比较分析,VibeVoic…

  2. SIGNIFICANT · CL_233085 ·

    Microsoft 发布 VibeVoice-ASR-Streaming 用于实时语音识别

    Microsoft 发布了 VibeVoice-ASR-Streaming,这是一种新颖的基于 LLM 的端到端模型,用于实时、说话人归属的语音识别。该系统统一了自动语音识别 (ASR) 和说话人分割,解决了先前统一模型的延迟问题。VibeVoice-ASR-Streaming 模型以小前瞻处理音频块,从而在语音到达时立即输出“谁说了什么”。Microsoft 已公开了 1.5B 和 7B 模型权重。

  3. SIGNIFICANT · CL_160855 ·

    Microsoft 发布 VibeVoice-ASR-BitNet 以实现实时 CPU 推理

    Microsoft 发布了 VibeVoice-ASR-BitNet,这是一款高度压缩的自动语音识别模型,专为在边缘 CPU 上进行实时推理而设计,无需 GPU。该模型在实时因子 (RTF) 低于 1 的情况下,仅使用三个 CPU 线程,与 Whisper.cpp 等现有解决方案相比实现了显著的加速。通过异构量化实现压缩,将模型大小从 4.62 GB 减小到 1.58 GB,同时保持可比的准确性并支持多种语言。