实体
LibriSpeech-PC
LibriSpeech-PC
PulseAugur coverage of LibriSpeech-PC — every cluster mentioning LibriSpeech-PC across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
语音合成评估受自动语音识别家族对齐干扰,提出新的集成方法
研究人员发现,在使用自动语音识别(ASR)验证器评估文本到语音(TTS)系统时存在一个重大的混淆因素。这些验证器的表面质量很大程度上受用于判断的ASR家族影响,导致排名颠倒和性能指标虚高。为解决此问题,该论文提出跨家族排名集成方法,该方法可实现更低的词错误率,并在其他指标上保持性能,建议进行跨评估器三角测量以获得稳健的报告。
-
PoDAR框架分离音频信号功率,以实现更快的生成模型
研究人员推出了一种名为PoDAR的新型框架,旨在通过将信号功率与语义内容分离开来来增强音频生成模型。该方法利用随机功率增强和潜在一致性目标来创建更易于建模的潜在空间。当与Stable Audio 1.0等现有模型集成时,PoDAR已证明在收敛时间上实现了两倍的加速,同时提高了说话人相似度和整体音频质量等指标。