阿里巴巴的通义实验室发布了Qwen-Audio-3.0-TTS,这是一个先进的文本转语音模型,提供两个版本:用于实时交互的Flash版本和用于高质量生成的Plus版本。该模型在细粒度控制、指令遵循、16种语言的多语言支持以及鲁棒性方面都有显著改进。Qwen-Audio-3.0-TTS-Plus在文本转语音质量方面的人工分析排行榜上名列前茅,其预览版本此前也曾位居榜首。 AI
影响 在TTS质量基准上设定了新的SOTA(State-of-the-Art),并为开发者提供了先进的控制功能。
排序理由 前沿实验室模型发布,附带系统卡 [lever_c_demoted from frontier_release: ic=2 ai=1.0]
- Alibaba Group
- Artificial Analysis
- Fun-Realtime-TTS
- Qwen-Audio-3.0-TTS
- Qwen-Audio-3.0-TTS-Plus
- Alibaba Cloud Model Studio
- DashScope
- Tongyi Lab
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →