研究人员开发了GemTalk,一个新颖的、基于扩散的框架,用于生成逼真且可控的情感说话人脸视频。该系统通过整合用于语义丰富的隐式表示和用于结构精度的显式几何先验,解决了现有方法的局限性。GemTalk利用视觉引导音频情感投影模块和基于扩散的几何先验生成器来提取和优化情感及面部表情特征,从而在不影响视觉质量的情况下实现对情感强度的细粒度控制。 AI
影响 该框架有望提高AI生成视频中情感表达的逼真度和可控性。
排序理由 该条目是一篇学术论文,详细介绍了一种新的AI驱动视频生成方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Connected Papers
- CORE Recommender
- DagsHub
- Diffusion-based Geometric Priors Generator
- GemTalk
- Geometry-guided Emotion Modulation
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- ScienceCast
- scite Smart Citations
- Vision-guided Audio Emotion Projection
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →