OpenMOSS-Team 发布了其文本转语音模型 MOSS-TTS-Local-Transformer-v1.5 的更新版本。新版本在 v1.0 的基础上,提供了更高保真度的立体声音频建模,采样率为 48 kHz。它还通过语言标签改进了多语言合成,支持更稳定的语音克隆,更好地处理长参考音频以进行短文本克隆,并实现了更精确的标点符号跟随韵律。该模型现在支持使用内联标记进行显式停顿控制,并将语言支持扩展到 31 种语言,包括新增的粤语、荷兰语和印地语。 AI
影响 增强了使用开源 TTS 模型的开发者的能力,提供了更高的保真度和更广泛的语言支持。
排序理由 发布了一个功能改进的开源文本转语音模型的新版本。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Trending Models 阅读 →
- Google Colab
- Kaggle
- MOSS-Audio-Tokenizer-v2
- MOSS-TTS-Local-Transformer-v1.0
- OpenMOSS-Team
- OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →