研究人员正在探索超越传统平均意见分(MOS)的语音质量评估新方法。一篇论文介绍了PrefSQA,它使用成对偏好预测来减少评分者变异性并提高可靠性,尤其是在高质量偏好数据集上。另一项研究调查了人类听者与MOS预测模型之间的差异,发现模型虽然能追踪声学退化,但常常忽略韵律错误并表现出说话者特征的偏差。第三篇论文提出NVMOS用于评估非语言发声的质量,并证明像Gemini这样的当前多模态大型语言模型在此任务上存在困难,且不能可靠地替代人类专家判断。 AI
影响 语音质量评估的进步可以改进文本到语音系统和其他音频技术的开发和评估。
排序理由 多篇研究论文发布在arXiv上,详细介绍了语音质量评估的新方法和发现。
- arXiv
- Gemini
- NVMOS
- NV-TTS
- acoustic degradation
- fundamental frequency
- Mean opinion score
- MOS prediction models
- Pitch
- prosodic errors
- speaker characteristics
- speech synthesis
- PrefSQA
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →