PulseAugur
实时 03:16:48

阿里巴巴推出Qwen-Audio-3.0-TTS,支持16种语言并位列排行榜榜首

阿里巴巴的通义实验室发布了Qwen-Audio-3.0-TTS,这是一个先进的文本转语音模型,提供两个版本:用于实时交互的Flash版本和用于高质量生成的Plus版本。该模型在细粒度控制、指令遵循、16种语言的多语言支持以及鲁棒性方面都有显著改进。Qwen-Audio-3.0-TTS-Plus在文本转语音质量方面的人工分析排行榜上名列前茅,其预览版本此前也曾位居榜首。 AI

影响 在TTS质量基准上设定了新的SOTA(State-of-the-Art),并为开发者提供了先进的控制功能。

排序理由 前沿实验室模型发布,附带系统卡 [lever_c_demoted from frontier_release: ic=2 ai=1.0]

在 36氪 (36Kr) 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

阿里巴巴推出Qwen-Audio-3.0-TTS,支持16种语言并位列排行榜榜首

报道来源 [2]

  1. 36氪 (36Kr) TIER_1 中文(ZH) ·

    阿里巴巴发布语音合成大模型 Qwen-Audio-3.0-TTS

    36氪获悉,7月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方榜单Artificial Analysis,Qwen-Audio-3.0-TTS-Plus登顶,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。

  2. MarkTechPost TIER_1 English(EN) · Asif Razzaq ·

    阿里巴巴通义实验室发布 Qwen-Audio-3.0-TTS,提供 16 种语言的 Flash 和 Plus 级别托管文本转语音模型

    <p>Alibaba&#8217;s Tongyi Lab has released Qwen-Audio-3.0-TTS, a production-oriented text-to-speech (TTS) system. The model ships in two variants from the same lineage. Flash targets real-time interaction. Plus targets high-quality generation. Both are delivered as hosted models …