PulseAugur
实时 10:40:34
实体 Text-to-Audio-Video

Text-to-Audio-Video

PulseAugur coverage of Text-to-Audio-Video — every cluster mentioning Text-to-Audio-Video across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_187154 ·

    Vorch-Streamer 实现实时、长格式头像音视频生成

    研究人员开发了 Vorch-Streamer,这是一个专为从文本进行实时、长格式头像音视频生成而设计的新框架。该系统通过采用混合教师强制和扩散强制的训练后方法,解决了连续合成中的错误累积和视觉漂移等挑战。Vorch-Streamer 还利用外部语言模型预测语音进展,确保音频和视觉内容之间的对齐,并实现了 27.12 FPS 的生成速率,超过了实时播放要求。