两篇新研究论文探讨了零样本文本到语音(TTS)技术的进展,重点关注离散流匹配技术。第一篇论文介绍了DiFlow-TTS,一个使用离散流匹配方法来平衡生成质量和推理效率的框架,解决了自回归和连续空间基于流的模型存在的局限性。第二篇论文《Mask, Sample, Revise》提出了一种用于离散流匹配TTS的推理时堆栈,在不显式使用持续时间预测器的情况下,增强了从神经编解码器令牌生成语音的控制力和鲁棒性。 AI
影响 这些论文引入了文本到语音合成的新技术,可能带来更高效、更高质量的语音生成系统。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了文本到语音合成的新方法。
- Alef Iury Siqueira Ferreira
- Continuous-Time Markov Chain
- Discrete Flow Matching
- Mask, Sample, Revise
- Text-to-Speech
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- DiFlow-TTS
- Gotit.pub
- Hugging Face
- Ngoc Son Nguyen
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →