研究人员开发了TontaubeV1,这是一种新颖的文本到语音模型,旨在平衡自然韵律和高效的流式传输能力。该模型利用分层DualCodec表示,分离语义和声学信息来预测话语时长并优化音频。TontaubeV1可以处理长达一分钟的参考音频进行语音调理,并在单个RTX 5090 GPU上实现约200毫秒的流式传输延迟。基准测试表明,其韵律质量可与ElevenLabs Flash v2.5相媲美,并优于其他领先模型。 AI
影响 该模型的流式传输能力和韵律质量有望推动实时语音应用和内容生成的发展。
排序理由 该条目描述了一个新的模型发布,附带研究论文和已发布的权重。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- DualCodec
- ElevenLabs Flash v2.5
- Fish Audio S2 Pro
- Gradium API
- Hugging Face
- Qwen3 0.6B
- Qwen3 1.7B
- RTX 5090
- TontaubeV1
- VibeVoice
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →