MMS TTS
PulseAugur coverage of MMS TTS — every cluster mentioning MMS TTS across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架诊断复杂多语言文本语音合成的失效问题
研究人员开发了一个新框架,用于评估低资源多语言文本到语音(TTS)系统在处理复杂文本输入时的鲁棒性。该框架评估了泰语、越南语、斯瓦希里语和印度尼西亚语等语言在内容一致性、语言一致性和生成稳定性方面的表现。该研究引入了自动诊断指标和文本风险评分(TRS),无需手动标注或模型训练即可预测合成风险。在OmniVoice、VoxCPM2和MMS-TTS上的实验揭示了在处理数字、日期、命名实体和代码转换表达时存在不同的失效模式,凸显了当前评估方法的局限性。
-
新框架对跨不同语音领域的TTS系统进行基准测试
一项发表在arXiv上的新研究介绍了一个用于评估文本到语音(TTS)系统的综合基准测试框架,特别关注低资源语言和不同的语音领域。该研究评估了四种最先进的TTS系统——Indic Parler-TTS、MMS TTS、Microsoft Edge TTS和Google Gemini TTS——结合了主观听力测试、说话人相似度评分和声学分析。研究结果表明,不同领域的性能差异显著,情感语音构成最大的挑战,而对话语音显示出最高的声学保真度。该…
-
首个埃菲克语语音合成系统问世
研究人员开发了首个端到端的文本到语音(TTS)系统,用于埃菲克语,一种在尼日利亚使用的低资源声调语言。该研究创建了一个包含2,632个发音的语料库,并评估了四种神经网络模型:VITS、MMS-TTS、SpeechT5和Orpheus-TTS。MMS-TTS表现最佳,MOS得分为3.80,但仍存在声调错误。研究结果强调了非洲语言需要更大的数据集和声调感知模型。
-
新框架审计TTS的语音学准确性
研究人员开发了一个新的框架来评估多语言文本转语音(TTS)系统,重点关注它们保留区分词义的语音学对比度的能力。平均意见分(MOS)等标准指标在此任务中不足。所提出的方法使用一个在人类语音上训练的分类器来根据特定语言的语音学模式审计TTS输出。当应用于Meta的MMS TTS系统(针对阿萨姆语)时,该框架显示某些元音被错误地发音,表明合成语音中的预期语音学与实际语音学之间存在差距。
-
新的卢森堡语SQA系统使用TTS,发布新的表达式语音语料库
研究人员开发了LuxSQA,一个用于卢森堡语(一种资源匮乏的语言)的口语问答系统。该系统利用文本到语音(TTS)技术生成合成口语问题,扩充了现有的基于文本的QA资源。通过使用多种TTS系统训练参数高效的架构,LuxSQA在卢森堡语测试集上取得了优异的性能,证明了合成数据在资源匮乏的SQA中的有效性。另外,一个名为LuxEmo的新的卢森堡语表达式语音语料库已从广播节目中创建,包含21小时的数据,涵盖四种情绪类别,并使用五种TTS系统进行了基准测试。