研究人员开发了Poly-InstructTTS,这是一种新颖的文本到语音模型,能够根据自然语言指令生成表现力语音。该系统利用了一个大型的、野外的1000小时视听数据集,该数据集带有1000多种不同的情绪和风格的注释。Poly-InstructTTS采用了无提示GPT架构和用于音色注入的流匹配模块,以及用于保持个性的说话人微调程序。评估表明在指令遵循和表现力方面表现强劲,并提供了配套的音频演示和扩展的测试集。 AI
影响 能够生成更细致、更可控的表现力语音,可能影响语音助手和内容创作。
排序理由 详细介绍用于语音合成的新模型和数据集的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- generative pre-trained transformer
- Gotit.pub
- Hugging Face
- InstructTTSEval
- Poly-InstructTTS
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →