研究人员开发了 GEPARD,这是一种新颖的文本到语音模型,专为实时对话应用而设计。该模型利用 LLM 主干进行自回归语音生成,并利用神经编解码器进行波形解码,使其能够在处理文本时逐步流式传输音频。GEPARD 经过工程设计,可与 vLLM 等标准 LLM 服务引擎高效运行,在单流情况下实现约 0.067 的实时因子(比实时快 15 倍),并在并发使用下实现显著的聚合加速。 AI
影响 该模型可以显著提高 AI 驱动的对话代理的响应能力和自然度。
排序理由 详细介绍新型 TTS 模型的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →