研究人员推出了 UltraVoice,这是一个旨在改进口语对话模型中细粒度语音风格控制的大规模数据集。该数据集包含超过 830 小时的语音对话,涵盖六个风格维度:情绪、语速、音量、口音、语言和复合风格的指令。在 UltraVoice 上微调 SLAM-Omni 和 VocalNet 等模型,在风格可控性和指令遵循方面显示出显著的改进,同时不影响核心对话能力。该数据集的实用性也延伸到训练可控的文本到语音模型。 AI
影响 增强了口语对话系统中类似人类的交互,并改进了可控的文本到语音模型。
排序理由 该集群包含一篇详细介绍语音合成新数据集和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →