研究人员开发了 Marco-Voice,一个集成了语音克隆和情感控制的新型语音合成系统。该系统解决了在保持说话人身份的同时,生成富有表现力、自然且跨越不同情感和语言的语音所面临的挑战。Marco-Voice 利用说话人-情感解耦机制和旋转式情感嵌入集成方法来实现精细控制。该系统使用新构建的普通话语音数据集 CSEMOTIONS 进行了评估,并在语音清晰度和情感丰富度的客观和主观指标上展现出有竞争力的性能。 AI
影响 这项研究推动了富有表现力的神经语音合成技术,有望实现更自然、更富含情感细微差别的 AI 驱动语音应用。
排序理由 该集群包含一份详细介绍新型语音合成系统的技术报告,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Chenyang Lyu
- CSEMOTIONS
- DagsHub
- Gotit.pub
- Hugging Face
- Marco-Voice
- ScienceCast
- Standard Chinese
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →