PulseAugur
实时 06:54:53
English(EN) Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions

新TTS模型从开放式指令中学习表现力语音

研究人员开发了Poly-InstructTTS,这是一种新颖的文本到语音模型,能够根据自然语言指令生成表现力语音。该系统利用了一个大型的、野外的1000小时视听数据集,该数据集带有1000多种不同的情绪和风格的注释。Poly-InstructTTS采用了无提示GPT架构和用于音色注入的流匹配模块,以及用于保持个性的说话人微调程序。评估表明在指令遵循和表现力方面表现强劲,并提供了配套的音频演示和扩展的测试集。 AI

影响 能够生成更细致、更可控的表现力语音,可能影响语音助手和内容创作。

排序理由 详细介绍用于语音合成的新模型和数据集的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新TTS模型从开放式指令中学习表现力语音

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Junhui Zhang, Qianhui Xu, Qingxiang Guo, Dawei Yang, Ling Miao, Qiangqiang Wang, Yang Song ·

    Poly-InstructTTS:从开放式指令中学习野外富有表现力的语音合成

    arXiv:2608.20387v1 Announce Type: cross Abstract: While recent text-to-speech (TTS) models achieve high naturalness, controlling fine-grained expression via natural-language instructions remains challenging. We introduce Poly- InstructTTS, which learns expressive speech from open…