研究人员开发了 TontaubeV1,一个开源的文本到语音 (TTS) 模型,能够生成长篇、富有表现力的语音。这个字符级模型基于 Qwen3-1.7B 检查点和 DualCodec 音频编解码器构建,支持低延迟本地推理和零样本语音克隆。关键创新包括字符级分词,据报道,这比标准的 BPE 分词器在 TTS 任务上更具鲁棒性,以及一种新颖的分块和位置方案,可以更有效地对齐文本和音频流以实现连续生成。 AI
影响 这个字符级 TTS 模型可以提高长文本语音生成的质量和效率,可能对有声读物制作和虚拟助手产生影响。
排序理由 该集群描述了一个具有新颖技术方法的新型开源 TTS 模型的发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →