研究人员开发了SALSA-V,这是一种新颖的多模态模型,旨在从无声视频内容生成同步、高保真的音频。该模型利用掩码扩散目标进行音频条件生成,并能生成任意长度的音频。通过引入快捷损失,SALSA-V仅需八个采样步即可实现快速、高质量的音频合成,有潜力支持近乎实时(near real-time)的应用。 AI
影响 能够从视频中生成高保真、同步音频,可能影响内容创作和实时应用。
排序理由 该集群包含一篇描述新模型及其功能的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →