实体
DNSMOS
DNSMOS
PulseAugur coverage of DNSMOS — every cluster mentioning DNSMOS across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
研究发现,语音质量指标在清晰音频上表现不佳
arXiv上的一篇新研究论文探讨了UTMOS、DNSMOS和SCOREQ等无参考语音质量指标在评估现代文本到语音(TTS)系统方面的有效性。研究发现,虽然这些指标可以识别可听见的缺陷,但在区分高质量音频中的听众偏好方面却难以可靠地进行区分。该研究提出了一个复合指标作为更稳健的评估方法,并指出使用单一分数奖励来优化TTS模型可能导致不良的“奖励破解”,即指标有所改善,但实际人类感知的质量却下降了。
-
LLM 引导强化学习以增强视听语音
研究人员开发了一种新颖的视听语音增强(AVSE)系统,该系统利用大型语言模型(LLM)来指导强化学习过程。该方法不依赖于 SI-SNR 等传统指标,而是采用 LLM 生成语音质量的自然语言描述,然后将其转换为奖励信号,用于微调 AVSE 模型。在 AVSEC-4 数据集上的实验表明,这种 LLM 引导的方法在各种客观和主观听力测试中均优于监督基线和基于 DNSMOS 的 RL 基线。