实体
Confucius4-TTS
Confucius4-TTS
PulseAugur coverage of Confucius4-TTS — every cluster mentioning Confucius4-TTS across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
最近 · 第 1/1 页 · 共 2 条
-
Confucius4-TTS:新的零样本 TTS 系统可跨 14 种语言克隆声音
研究人员开发了 Confucius4-TTS,一个新颖的多语言零样本文本到语音系统,能够在无需参考音频转录的情况下跨 14 种语言克隆声音。该系统采用两阶段架构,其中文本到语义模块利用可学习的说话人编码器,语义到声学模块用于梅尔频谱生成。Confucius4-TTS 在跨语言基准测试中表现强劲,在 CV3-Eval 上实现了 3.73% 的词错误率,并在人类评估中排名靠前。
-
网易有道发布开源14语声纹克隆TTS模型
网易有道推出了Confucius4-TTS,这是一款支持14种语言的新型大型TTS引擎。该引擎的特点是能够通过零样本学习(zero-shot learning)进行声音克隆,仅需3秒音频,无需参考文本即可复刻说话者的语调和情感。该模型完全开源,权重和工具均可用于本地部署,旨在降低数字人、跨语言交流等领域的创作者和开发者的成本和门槛。