一位Reddit用户分享了MiniMax H3 Ref2VA模型的演示,该模型可以根据图像和音频输入生成唇同步视频。示例使用了Gemini生成的Idina Menzel的图像,以及Idina Menzel演唱的《Let It Go》的音频。该模型在没有明确歌词提示的情况下,成功地将唇部动作与音频同步,并利用了Kijai的LX2V LoRA和Sage Attention Patch。 AI
影响 展示了AI驱动的视频合成技术的进步,为生成内容提供了更逼真的唇同步能力。
排序理由 展示了一个用于视频生成的AI模型,而非前沿实验室的新发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →