美团发布了 LongCat-Video-Avatar 1.5,这是一个用于生成音频驱动的人类视频的开源框架。此升级版本强调生产就绪性和稳定性,采用改进的 Whisper-Large 音频编码器,可实现更自然的唇形同步和具有一致身份的鲁棒长视频生成。该模型支持音频-文本到视频和视频续写等多种任务,能够泛化到各种风格和条件,并实现高效的 8 步推理。 AI
影响 通过专注于稳定性和效率,加速了音频驱动视频生成工具的开发。
排序理由 重要 AI 实验室(美团)发布新的开源模型。
在 Hugging Face Trending Models 阅读 →
- Hugging Face
- LongCat-Video-Avatar 1.5
- meituan-longcat
- Whisper-Large
- LongCat-Video
- Meituan
- meituan-longcat/LongCat-Video-Avatar-1.5
AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →