研究人员开发了一个新的基准来评估自动文本到语音(TTS)系统,超越了简单的自然度指标。该基准将语音质量分解为10个不同的语言学维度,使用了860个发音的训练有素的语言学家的注释。对四个平均意见得分(MOS)预测器和四个音频大型语言模型(Audio-LLM)裁判的评估表明,MOS预测器仅关注声学信号质量,而Audio-LLM则表现出不覆盖所有维度的提示依赖性检测。这两种方法都不能可靠地识别广泛的语言学结构语音错误,凸显了对更细致的TTS评估的需求。 AI
影响 这项研究为TTS模型引入了一个更细致的评估框架,有可能带来更准确、更具语言意识的语音合成系统。
排序理由 该集群包含一篇详细介绍TTS系统评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Audio Large Language Models
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Mean Opinion Score
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →