研究人员开发了X2Streaming-TTS,一个新颖的文本到语音系统,专为从流式文本进行真正的逐词合成而设计。该框架在文本词元到达时进行处理,生成语音而无需未来输入。它包含因果承诺来管理不确定的文本前缀,以及因果语音状态继承来在片段边界之间保持声学连续性。实验表明,X2Streaming-TTS在质量上优于现有的伪流式模型,并实现了低延迟,单次请求的首次音频词元的中位时间为15.8毫秒。 AI
影响 通过提供真正的逐词语音合成,实现了低延迟的口语对话系统。
排序理由 详细介绍新模型及其功能的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →