研究人员开发了 DEFINE,一个新颖的端到端零样本文本到语音 (TTS) 框架,该框架将说话人身份与口音控制解耦。通过对身份和目标口音的独立音频示例进行条件设置,DEFINE 允许在不重新训练的情况下对口音强度进行连续控制。该系统基于 F5-TTS 和 LoRA 适配构建,在口音准确性和对未见口音的泛化能力方面有所提高,在保持更高的说话人相似性的同时,达到了更复杂级联系统的性能。 AI
影响 这项研究通过实现说话人身份和口音的独立控制,推进了零样本 TTS 的能力,有望带来更通用、更可控的语音生成系统。
排序理由 该集群包含一篇详细介绍文本到语音合成新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →