PulseAugur
实时 17:06:43
实体 Seed-TTS

Seed-TTS

PulseAugur coverage of Seed-TTS — every cluster mentioning Seed-TTS across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_160681 ·

    AI 模型加速语音合成并实现实时翻译

    研究人员开发了 Faster IndexTTS-2,一个显著加速 GPU 部署的自回归文本到语音模型系统。新版本将 GPT 组件的推理速度提高了 5.0 倍,端到端速度提高了 3.6 倍,同时还能实现流式合成和批量推理,而对音频质量的影响极小。另外,OpenAI 已悄然推出 GPT-Realtime-Translate,一个能够跨 70 多种语言进行实时翻译的语音到语音翻译模型,定价为每分钟 0.034 美元。

  2. RESEARCH · CL_53474 ·

    新框架和基准推动视听生成发展

    研究人员推出了OmniCustom,一个可以同时从参考图像和音频定制视频身份和音频音色的框架。这个基于DiT的模型使用独立的LoRA模块进行身份和音色控制,并通过对比学习目标进行增强。此外,NAVA框架为联合生成提供了原生的视听对齐,使用一个6.3B参数的模型提高了同步性和音色可控性。另外,LongAV-Compass已被开发为一个基准,用于评估跨越各种条件模态的分钟级视听生成,评估长时间内的连贯性和对齐性。