PulseAugur
实时 10:31:40
English(EN) Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

Confucius4-TTS:新型TTS系统实现免转录跨语言语音克隆

研究人员开发了Confucius4-TTS,一种新颖的文本到语音(TTS)系统,能够实现免转录、跨语言的零样本语音克隆。该系统支持14种语言,并采用由文本到语义和语义到声学模块组成的双阶段架构。文本到语义模块采用可学习的说话人编码器,从语音表示中捕获音色;语义到声学模块则生成梅尔频谱图。Confucius4-TTS在跨语言基准测试中表现强劲,在CV3-Eval上实现了3.73%的平均词错误率,并在人类评估中优于其他开源和商业系统。 AI

影响 这项进展可能显著提高跨语言语音应用和内容创作的可访问性和效率。

排序理由 详细介绍新型TTS模型及其新功能的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Confucius4-TTS:新型TTS系统实现免转录跨语言语音克隆

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Huaxuan Wang, Huimin Wang, Ruiyu Zhang, Yingjie Li, Yitao Duan ·

    Confucius4-TTS:无需文本的跨语言零样本 TTS 与可学习说话人编码器

    arXiv:2608.11650v1 Announce Type: cross Abstract: Recent advances in zero-shot text-to-speech (TTS) have substantially improved speech quality and voice cloning fidelity. However, many zero-shot TTS systems still depend on audio prompt transcripts at inference time. This dependen…