PulseAugur
中
实时 09:11:45
实体 Common Voice

Common Voice

PulseAugur coverage of Common Voice — every cluster mentioning Common Voice across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. MEME · CL_259773 ·

    程序员因精神压力辞职,转而专注于Common Voice的语言翻译

    作者因精神压力决定停止编程,现在正专注于Common Voice众包项目的翻译工作。他们正在将阿乔米语的Bandari方言进行翻译,目标是将其语言纳入该项目。由于方言差异以及其语言缺乏标准化的书写形式,作者独自承担这项翻译工作。

  2. TOOL · CL_254602 ·

    剪枝Whisper-small通过充当正则化器来提高ASR准确性

    研究人员已经证明,神经网络剪枝可以作为自动语音识别(ASR)系统的正则化技术,而不仅仅是压缩方法。通过分析Whisper-small模型中不同组件的敏感性,他们发现剪枝特定层,如解码器自注意力或最后一个编码器层,实际上可以提高泛化能力并降低词错误率(WER)。这种方法允许更积极的压缩而不会显著损失准确性,表明剪枝可以成为一个有价值的架构设计工具。

  3. RESEARCH · CL_245231 ·

    BuzzASR发布100多款语言专用语音模型,性能超越Whisper

    研究人员开发了BuzzASR,这是一套经过微调的、针对不同语言的100多款专用语音识别模型。这些模型基于Whisper架构,在许多语言上,特别是原始训练数据中代表性较低的语言上,其性能显著优于通用的Whisper Large V3模型。BuzzASR模型在27种语言的开源系统中达到了最先进的字符错误率,并引入了一种改进压缩率的分词器替换策略。

  4. TOOL · CL_223212 ·

    新的TTS流水线通过基于音素的增强功能改进ASR系统

    研究人员开发了一个统一的流水线,用于生成合成语音以改进自动语音识别(ASR)系统。该流水线使用多语言文本到语音(TTS)模型F5-TTS,并带有语言ID条件。一种名为音素频率引导选择(PFGS)的新颖方法根据音素频率对候选句子进行排名,在阿拉伯语、法语、意大利语和葡萄牙语的实验中,其表现优于随机选择和仅真实数据训练。

  5. RESEARCH · CL_222322 ·

    语音克隆技术被重新用于匿名化,引发安全担忧

    研究人员发现了一种无需重新训练即可将XTTSv2语音克隆模型重新用于说话人匿名化的方法。该模型在大量语音数据上训练而成,能够独立于说话人身份保留韵律结构,通过条件化伪说话人来实现语音转换。迭代优化策略在隐私和效用之间取得平衡,与七种欧洲语言中现有的匿名化方法相比,在隐私性和可懂度方面表现优异,语音质量也更胜一筹。

  6. TOOL · CL_200003 ·

    新基准比较了尼泊尔ASR的多语言模型

    一项新研究使用标准化的微调协议,对尼泊尔自动语音识别(ASR)的六个多语言预训练模型进行了基准测试。研究发现,Whisper-Large-v3-Turbo 和 IndicWav2Vec 的表现相当,表明预训练中的语系接近性对于尼泊尔ASR可以与单纯的规模一样有效。研究还强调,与Whisper等自回归模型相比,CTC解码器在相似的准确度水平下提供了显著更快的性能,因此对于有延迟限制的应用来说是更可取的。这项工作为尼泊尔ASR提供了第一个…

  7. TOOL · CL_168923 ·

    OpenAI为API推出新的上下文感知转录模型

    OpenAI已推出两个新的API转录模型:GPT-Live-Transcribe用于实时、低延迟音频,GPT-Transcribe用于异步任务。这两个模型都旨在更好地理解上下文,从而提高在各种语言、口音和嘈杂环境中的准确性。开发者可以提供上下文信息、关键词和语言偏好,以进一步提高转录质量。

  8. TOOL · CL_149070 ·

    ai-sage 发布 GigaAM Multilingual 语音模型

    ai-sage 发布了 GigaAM Multilingual,这是一系列基于 Conformer 的基础模型。这些模型有 2.2 亿和 6 亿参数的变体,已在超过 70 种语言的 200 万小时以上语音数据上进行了预训练。它们针对自动语音识别 (ASR) 进行了微调,在俄语、哈萨克语、吉尔吉斯语和乌兹别克语方面提供顶级开源性能,在英语方面性能中等。

  9. RESEARCH · CL_65569 ·

    新的ASR方法应对计算扩展和多语言评估

    研究人员正在开发新的方法来改进自动语音识别(ASR)系统。一种名为LARM的方法使用深度条件循环Transformer,允许可调的测试时间计算,实现了与更深层模型相媲美的性能。另一个系统Murmur通过平衡低延迟的基于块的处理和准确性的长上下文模型,利用注意力稀疏性来处理长篇ASR。此外,还提出了一种名为脚本归一化WER(SN-WER)的新指标,通过对脚本差异进行归一化,以更准确地评估多语言环境下的ASR性能,特别是对于印度语言。

  10. TOOL · CL_38321 ·

    新的 SBPN 模型通过知识蒸馏提升尼日利亚语言 ASR 性能

    研究人员开发了一个名为 Sometin Beta Pass Notin (SBPN) 的新多语言自动语音识别 (ASR) 框架,以提高尼日利亚语言的性能。该框架采用两阶段知识蒸馏过程,首先从单一语言模型进行蒸馏,然后通过伪标记数据的迭代自我改进。该方法在 Common Voice 和 Fleurs 等基准测试中,相对于基线平均降低了 29% 的词错误率,并且优于现有的最先进的多语言模型。SBPN 以两种尺寸发布为开放基础模型,旨在为该…

  11. RESEARCH · CL_00307 ·

    Coqui 和 Hugging Face 推进开源语音克隆(需获得同意)

    Coqui 是一家语音技术初创公司,正在为开源语音技术和语音克隆做出重大贡献。该公司专注于开放访问的模型和数据,能够创建富有情感共鸣的克隆声音。创作者正在利用 Coqui 的工作来开发新的人工智能驱动的应用程序。