PulseAugur
中
实时 00:38:50
实体 text-to-audio-video generation

text-to-audio-video generation

PulseAugur coverage of text-to-audio-video generation — every cluster mentioning text-to-audio-video generation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_239312 ·

    新的PRISM-Bench评估文本到视频生成中的音频

    研究人员推出了PRISM-Bench,这是一个专门用于评估文本到音频视频(T2AV)系统音频生成能力的新基准。与以往将音频视为次要或孤立评估的基准不同,PRISM-Bench侧重于音频质量、与视觉的连贯性、表现力和提示遵循度。它使用一个包含900个经过人类验证的样本的数据集和一个MLLM-as-a-Judge协议来确保可靠的评分,并显示出与人类评估者的高度一致性。该基准的分析表明,当前的T2AV模型在复杂的音频接地方面存在困难,尤其是…

  2. TOOL · CL_166870 ·

    OmniVAE 引入具有跨模态对齐的联合音频-视频生成

    研究人员开发了OmniVAE,这是一种新颖的变分自编码器,专为同步音频和视频的联合生成而设计。与之前分别训练音频和视频VAE的方法不同,OmniVAE学习两种模态之间的细粒度语义对齐。它采用片段级音频-视频对比目标来捕获时间-语义对应关系,并从预训练的语义编码器中提取特征以增强下游学习能力。实验表明,这些技术提高了生成音频-视频内容的质量和同步性,尤其是在文本到音频-视频生成任务中。