PulseAugur
实时 17:57:12
实体 Common Voice

Common Voice

PulseAugur coverage of Common Voice — every cluster mentioning Common Voice across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_200003 ·

    新基准比较了尼泊尔ASR的多语言模型

    一项新研究使用标准化的微调协议,对尼泊尔自动语音识别(ASR)的六个多语言预训练模型进行了基准测试。研究发现,Whisper-Large-v3-Turbo 和 IndicWav2Vec 的表现相当,表明预训练中的语系接近性对于尼泊尔ASR可以与单纯的规模一样有效。研究还强调,与Whisper等自回归模型相比,CTC解码器在相似的准确度水平下提供了显著更快的性能,因此对于有延迟限制的应用来说是更可取的。这项工作为尼泊尔ASR提供了第一个…

  2. TOOL · CL_168923 ·

    OpenAI为API推出新的上下文感知转录模型

    OpenAI已推出两个新的API转录模型:GPT-Live-Transcribe用于实时、低延迟音频,GPT-Transcribe用于异步任务。这两个模型都旨在更好地理解上下文,从而提高在各种语言、口音和嘈杂环境中的准确性。开发者可以提供上下文信息、关键词和语言偏好,以进一步提高转录质量。

  3. TOOL · CL_149070 ·

    ai-sage 发布 GigaAM Multilingual 语音模型

    ai-sage 发布了 GigaAM Multilingual,这是一系列基于 Conformer 的基础模型。这些模型有 2.2 亿和 6 亿参数的变体,已在超过 70 种语言的 200 万小时以上语音数据上进行了预训练。它们针对自动语音识别 (ASR) 进行了微调,在俄语、哈萨克语、吉尔吉斯语和乌兹别克语方面提供顶级开源性能,在英语方面性能中等。

  4. RESEARCH · CL_65569 ·

    新的ASR方法应对计算扩展和多语言评估

    研究人员正在开发新的方法来改进自动语音识别(ASR)系统。一种名为LARM的方法使用深度条件循环Transformer,允许可调的测试时间计算,实现了与更深层模型相媲美的性能。另一个系统Murmur通过平衡低延迟的基于块的处理和准确性的长上下文模型,利用注意力稀疏性来处理长篇ASR。此外,还提出了一种名为脚本归一化WER(SN-WER)的新指标,通过对脚本差异进行归一化,以更准确地评估多语言环境下的ASR性能,特别是对于印度语言。

  5. TOOL · CL_38321 ·

    新的 SBPN 模型通过知识蒸馏提升尼日利亚语言 ASR 性能

    研究人员开发了一个名为 Sometin Beta Pass Notin (SBPN) 的新多语言自动语音识别 (ASR) 框架,以提高尼日利亚语言的性能。该框架采用两阶段知识蒸馏过程,首先从单一语言模型进行蒸馏,然后通过伪标记数据的迭代自我改进。该方法在 Common Voice 和 Fleurs 等基准测试中,相对于基线平均降低了 29% 的词错误率,并且优于现有的最先进的多语言模型。SBPN 以两种尺寸发布为开放基础模型,旨在为该…

  6. RESEARCH · CL_00307 ·

    Coqui 和 Hugging Face 推进开源语音克隆(需获得同意)

    Coqui 是一家语音技术初创公司,正在为开源语音技术和语音克隆做出重大贡献。该公司专注于开放访问的模型和数据,能够创建富有情感共鸣的克隆声音。创作者正在利用 Coqui 的工作来开发新的人工智能驱动的应用程序。