研究人员开发了STARCaster,一种新颖的视频扩散模型,用于创建同时感知身份和视角的说话人像。该模型将语音驱动动画和动态视角控制整合到一个单一框架中,克服了现有2D模型严重依赖参考引导以及3D模型可能出现的身份漂移等局限性。STARCaster采用组合式方法,从身份感知的运动开始,然后进行视听同步,最后实现新视角动画。为了解决4D视听数据稀缺的问题,该模型采用解耦学习策略,独立训练视角一致性和时间连贯性。评估表明,STARCaster在多个基准测试中,在任务和身份方面均优于先前的方法。 AI
影响 该模型有望推动逼真AI驱动的虚拟形象生成,应用于虚拟助手和内容创作等领域。
排序理由 该集群包含一篇详细介绍新模型的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Foivos Paraperas Papantoniou
- Gotit.pub
- Hugging Face
- ScienceCast
- STARCaster
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →