研究人员开发了无需对齐的 Text-Audiobox (Text-AB),一个用于语音配音和对话合成的新框架。该系统利用具有流匹配目标的扩散 Transformer,并在具有 DAC-VAE 特征的潜在扩散上运行,与先前的方法相比,实现了更高的压缩率和改进的再合成质量。Text-AB 无需对齐,通过交叉注意力学习文本-语音对齐,无需显式时长预测。一个大规模的 3B 参数模型在 480k 小时的语音上进行了预训练,并针对各种任务进行了微调,在配音和对话合成的韵律、声音相似度、自然度和人性化方面均取得了显著改进。 AI
影响 该框架可以显著提高语音配音和对话生成的质量和效率,对媒体制作和虚拟通信产生影响。
排序理由 该集群描述了一篇详细介绍用于文本到音频合成的新框架和模型的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →