实体
Resemblyzer
Resemblyzer
PulseAugur coverage of Resemblyzer — every cluster mentioning Resemblyzer across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新方法使文本到音频视频模型能够进行语音克隆
研究人员开发了一种为文本到音频视频(T2AV)生成模型添加语音克隆功能的方法。通过引入一个单一的零初始化线性层并进行微调,T2AV模型可以从简短的参考录音中克隆语音。这种方法在说话人编码器余弦相似度方面显著优于现有的语音克隆文本到语音基线。
-
新框架对跨不同语音领域的TTS系统进行基准测试
一项发表在arXiv上的新研究介绍了一个用于评估文本到语音(TTS)系统的综合基准测试框架,特别关注低资源语言和不同的语音领域。该研究评估了四种最先进的TTS系统——Indic Parler-TTS、MMS TTS、Microsoft Edge TTS和Google Gemini TTS——结合了主观听力测试、说话人相似度评分和声学分析。研究结果表明,不同领域的性能差异显著,情感语音构成最大的挑战,而对话语音显示出最高的声学保真度。该…