FireRedTeam 发布了 FireRedAudio,一个拥有 90 亿参数的音频语言模型,能够执行包括自动语音识别、音频理解以及各种文本到语音(TTS)在内的广泛任务。该模型利用解耦的连续表示进行理解和生成,使其能够处理和生成长达一小时的录音。与 FireRedAudio 一同发布的还有 FireRedTTS3,一个统一的语音生成和编辑系统,支持 24 种语言和 21 种中文方言的零样本语音克隆,并提供一个用于自然语言控制的指令变体。 AI
影响 此次发布提供了一种统一的音频处理和生成方法,有望简化处理语音和音频数据的开发者的工作流程。
排序理由 发布新的开源音频语言模型和 TTS 系统。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →