研究人员开发了一种新颖的文本到语音(TTS)合成方法,该方法模仿配音演员如何根据表演指令调整其发音。这种方法被称为指令遵循TTS,旨在生成反映特定风格变化但同时保持原始说话者身份和语言内容的语音。为了克服相关训练数据的稀缺性,该团队设计了一个可扩展的管道来构建伪三元组,伪三元组由参考话语、指令文本和修改后的话语组成。该管道利用一个可印象控制的TTS模型进行风格变化,并使用LLM从估计的印象差异中生成自然语言指令。实验表明,仅凭这些伪三元组就能实现稳定、保留说话者特征的修改,并且在与录制数据结合使用时,在指令对齐和说话者相似性方面取得了进一步的改进。 AI
影响 这项研究可能带来更细致、更可控的语音合成,从而实现需要动态语音调整的应用。
排序理由 详细介绍一种新的TTS合成方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction
- Text To Speech
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →