LJSpeech
PulseAugur coverage of LJSpeech — every cluster mentioning LJSpeech across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
DriftTTS:新型文本到语音模型无需蒸馏即可实现高质量合成
研究人员开发了 DriftTTS,这是一种新颖的少样本文本到语音模型,无需依赖预训练教师模型蒸馏或对抗性判别即可实现具有竞争力的合成质量。该模型在梅尔域特征空间中利用分布匹配漂移目标,并使用 on-policy rollout 进行训练。在 LJSpeech 数据集上,DriftTTS 在 MCD 和 WER 方面表现出色,并且在盲听测试中,其 MOS 分数可与真实数据媲美,优于 Matcha-TTS。
-
用户寻求帮助实现Calm TTS论文,面临语音克隆问题
一位用户正在寻求有关实现研究论文中描述的Calm文本到语音模型的帮助。他们在复制模型性能方面遇到了困难,在生成有意义的文本和实现准确的语音克隆方面遇到了问题。用户尝试了各种技术,包括计划采样和调整数据条件,但面临诸如梯度爆炸以及文本质量与语音保真度之间的权衡等挑战。他们正在寻求关于如何进行的建议,是重新审视论文、增加数据集大小,还是解决潜在的系统设计缺陷。
-
新的 OscillaTTS 系统增强了基于扩散的 TTS 中的表现力语音建模
研究人员开发了一种名为 OscillaTTS 的新型文本到语音系统,该系统改进了表现力语音中尖锐韵律过渡和快速音高变化的建模。该系统引入了一种自适应振荡非线性,可在保持信号稳定性的同时实现可控的周期性调制。在 LJSpeech 和 Emotional Speech Dataset 上的实验表明,在客观和主观评估中均取得了持续的改进,表明与使用 Snake 激活函数等静态非线性的现有方法相比,对表现力韵律动力学进行了更好的建模。