实体
CosyVoice3
CosyVoice3
PulseAugur coverage of CosyVoice3 — every cluster mentioning CosyVoice3 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新指标评估英语到中文S2ST中的词重音
研究人员开发了一种新的方法来评估和保留英语到中文语音到语音翻译(S2ST)中的词重音。他们创建了一个带重音标注的中文数据集和一个使用XLS-R的普通话重音检测器,并将其与英文EmphAssess系统集成,提出了一个新的跨语言重音评估客观指标。经过微调的CosyVoice3系统在保持翻译质量的同时,展示了改进的重音翻译能力,并且新的评估指标与人类判断显示出很强的相关性。
-
新模型统一语音和歌声生成
研究人员开发了新的统一模型,用于生成人类语音音频,能够同时生成语音和歌声。UniVoice 使用条件流匹配方法,分离内容、旋律和音色,从而能够独立控制语音韵律和歌唱旋律。UniSinger 基于多模态扩散 Transformer 构建,统一了说话人克隆歌曲生成与带伴奏的歌声转换。这两个模型在各自的任务上都展现了最先进的性能,为音频生成和音乐制作带来了新的可能性。