PulseAugur
实时 19:20:11
实体 Text-to-speech (TTS) processing

Text-to-speech (TTS) processing

PulseAugur coverage of Text-to-speech (TTS) processing — every cluster mentioning Text-to-speech (TTS) processing across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_84468 ·

    UR-BERT 实现支持495种语言的多语言TTS系统

    研究人员开发了UR-BERT,这是一种新颖的文本编码器,旨在显著扩展大规模多语言文本到语音(TTS)系统的能力。与受音素到音素资源限制的传统方法不同,UR-BERT将各种书写系统统一为通用的罗马化格式,从而支持495种语言。该系统还包含一个语音令牌预测目标,以提高语音准确性和文本-语音对齐,在现有基线上表现出优越的性能,并对新语言具有强大的泛化能力。

  2. COMMENTARY · CL_63198 ·

    人工智能语音技术合集包括TTS、STT和声音克隆

    这篇Mastodon帖子汇集了关于人工智能语音技术的资源。它涵盖了文本到语音(TTS)、语音到文本(STT)、语音合成和声音克隆。该页面作为笔记和链接的集合,供进一步探索这些人工智能驱动的音频功能。

  3. TOOL · CL_53765 ·

    新的 ParsVoice 语料库提升波斯语 TTS 能力

    研究人员推出了 ParsVoice,这是一个大规模的波斯语语音和文本数据新语料库,旨在推进波斯语的文本到语音(TTS)合成和其他语音处理任务。该数据集包含 2,200 小时的 TTS 就绪音频,拥有来自 1,815 名已识别说话人的超过 136 万个对齐片段,其规模远大于之前的波斯语语音数据集。创建过程涉及一个复杂的流程,包括微调 ParsBERT 模型、优化音频边界、恢复标点符号以及进行说话人识别和质量评估。通过微调多语言 TTS …

  4. COMMENTARY · CL_34630 ·

    人工智能语音技术:TTS、STT 和语音合成资源的精选集

    这篇 Mastodon 帖子汇集了关于人工智能语音技术的资源,涵盖文本到语音(TTS)、语音到文本(STT)和语音合成。它作为人工智能驱动的语音生成和识别的各个方面信息的中心枢纽。