研究人员开发了OmniVAE,这是一种新颖的变分自编码器,专为同步音频和视频的联合生成而设计。与之前分别训练音频和视频VAE的方法不同,OmniVAE学习两种模态之间的细粒度语义对齐。它采用片段级音频-视频对比目标来捕获时间-语义对应关系,并从预训练的语义编码器中提取特征以增强下游学习能力。实验表明,这些技术提高了生成音频-视频内容的质量和同步性,尤其是在文本到音频-视频生成任务中。 AI
影响 增强了同步音频-视频生成能力,可能改进虚拟代理和多模态AI应用。
排序理由 该集群描述了一篇详细介绍新模型架构和训练方法的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- audio-video VAE
- contrastive learning
- Hugging Face
- Multimodal Modeling of the Knee Joint
- Semantic Distillation from Neighborhood for Composed Image Retrieval
- text-to-audio-video generation
- variational auto-encoder
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →