PulseAugur
实时 14:20:09
English(EN) Conversational Human Audio-visual Talking Dialogue Generation

新的arXiv论文调研并生成逼真的说话头像

两篇新的arXiv论文探讨了生成逼真说话头像的进展。第一篇论文全面调研了现有技术,将其分为图像驱动、音频驱动、视频驱动和3D/神经渲染方法,并分析了当前的局限性和未来的挑战。第二篇论文介绍了CHAT框架,该框架可以根据文本提示生成成对的、响应式的视听对话片段,旨在为收集真实世界对话数据提供可扩展的替代方案。 AI

影响 这些论文推动了逼真数字人生成的最先进技术,对虚拟代理和内容创作具有重要意义。

排序理由 两篇在arXiv上发表的学术论文,详细介绍了说话头像生成的新方法和调研。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的arXiv论文调研并生成逼真的说话头像

报道来源 [2]

  1. arXiv cs.CV TIER_1 English(EN) · Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana Gowda ·

    从像素到肖像:谈话头像生成技术与应用综合研究

    arXiv:2308.16041v2 Announce Type: replace Abstract: Talking head generation has progressed rapidly from landmark- and GAN-based facial animation to diffusion models, neural rendering, 3D-aware avatars, and foundation-model-assisted systems. This progress has enabled increasingly …

  2. arXiv cs.CV TIER_1 English(EN) · Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song ·

    会话式人类视听说话对话生成

    arXiv:2607.02799v1 Announce Type: new Abstract: Large-scale dyadic interactive audio-visual dialogue (DIAD) datasets provide fundamental data resources for developing humanoid interactive virtual agents and digital humans. However, collecting such data is time-consuming, expensiv…