实体
Seed-TTS
Seed-TTS
PulseAugur coverage of Seed-TTS — every cluster mentioning Seed-TTS across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI 模型加速语音合成并实现实时翻译
研究人员开发了 Faster IndexTTS-2,一个显著加速 GPU 部署的自回归文本到语音模型系统。新版本将 GPT 组件的推理速度提高了 5.0 倍,端到端速度提高了 3.6 倍,同时还能实现流式合成和批量推理,而对音频质量的影响极小。另外,OpenAI 已悄然推出 GPT-Realtime-Translate,一个能够跨 70 多种语言进行实时翻译的语音到语音翻译模型,定价为每分钟 0.034 美元。
-
新框架和基准推动视听生成发展
研究人员推出了OmniCustom,一个可以同时从参考图像和音频定制视频身份和音频音色的框架。这个基于DiT的模型使用独立的LoRA模块进行身份和音色控制,并通过对比学习目标进行增强。此外,NAVA框架为联合生成提供了原生的视听对齐,使用一个6.3B参数的模型提高了同步性和音色可控性。另外,LongAV-Compass已被开发为一个基准,用于评估跨越各种条件模态的分钟级视听生成,评估长时间内的连贯性和对齐性。