PulseAugur
实时 20:33:42
English(EN) STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster视频扩散模型支持身份感知的说话人像

研究人员开发了STARCaster,一种新颖的视频扩散模型,用于创建同时感知身份和视角的说话人像。该模型将语音驱动动画和动态视角控制整合到一个单一框架中,克服了现有2D模型严重依赖参考引导以及3D模型可能出现的身份漂移等局限性。STARCaster采用组合式方法,从身份感知的运动开始,然后进行视听同步,最后实现新视角动画。为了解决4D视听数据稀缺的问题,该模型采用解耦学习策略,独立训练视角一致性和时间连贯性。评估表明,STARCaster在多个基准测试中,在任务和身份方面均优于先前的方法。 AI

影响 该模型有望推动逼真AI驱动的虚拟形象生成,应用于虚拟助手和内容创作等领域。

排序理由 该集群包含一篇详细介绍新模型的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

STARCaster视频扩散模型支持身份感知的说话人像

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou ·

    STARCaster:用于身份和视角感知对话肖像的时空自回归视频扩散模型

    arXiv:2512.13247v2 Announce Type: replace Abstract: This paper presents STARCaster, an identity-aware spatio-temporal video diffusion model that addresses both speech-driven portrait animation and dynamic viewpoint control, given an identity embedding or reference image, within a…