研究人员开发了一种为文本到音频视频(T2AV)生成模型添加语音克隆功能的方法。通过引入一个单一的零初始化线性层并进行微调,T2AV模型可以从简短的参考录音中克隆语音。这种方法在说话人编码器余弦相似度方面显著优于现有的语音克隆文本到语音基线。 AI
影响 通过允许自定义语音集成,能够生成更具个性化和逼真度的视听内容。
排序理由 该集群包含一篇学术论文,详细介绍了AI模型中语音克隆的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- ECAPA-TDNN
- Gotit.pub
- Hugging Face
- Resemblyzer
- ScienceCast
- Viacheslav Vasilev
- WavLM-SV
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →