研究人员开发了新的统一模型,用于生成人类语音音频,能够同时生成语音和歌声。UniVoice 使用条件流匹配方法,分离内容、旋律和音色,从而能够独立控制语音韵律和歌唱旋律。UniSinger 基于多模态扩散 Transformer 构建,统一了说话人克隆歌曲生成与带伴奏的歌声转换。这两个模型在各自的任务上都展现了最先进的性能,为音频生成和音乐制作带来了新的可能性。 AI
影响 这些模型推动了统一音频生成的最先进水平,可能对音乐制作和辅助工具产生影响。
排序理由 两篇介绍新音频生成模型的学术论文。
- CosyVoice3
- Diffusion Transformer
- F5-TTS
- UniVoice
- Vevo1.5
- Conditional flow matching
- MIDI
- Singing voice conversion
- Singing voice synthesis
- Text-to-speech
- UniSinger
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →