研究人员开发了 Confucius4-TTS,一个新颖的多语言零样本文本到语音系统,能够在无需参考音频转录的情况下跨 14 种语言克隆声音。该系统采用两阶段架构,其中文本到语义模块利用可学习的说话人编码器,语义到声学模块用于梅尔频谱生成。Confucius4-TTS 在跨语言基准测试中表现强劲,在 CV3-Eval 上实现了 3.73% 的词错误率,并在人类评估中排名靠前。 AI
影响 这一发展可能显著提高 AI 应用的跨语言语音克隆能力,从而实现更自然、更多样化的语音合成。
排序理由 该集群描述了一份技术报告,其中详细介绍了新发布的 TTS 模型及其相关的代码和检查点。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →