研究人员开发了CETalk,一个用于生成由音频驱动的富有表现力的3D说话人头动画的新框架。与使用离散情感类别的先前方法不同,CETalk利用连续的效价-唤醒度(VA)表示来实现更细致的情感控制。该系统通过多尺度时间建模方法解决了音频发音和情感表达之间的时间不匹配问题。为了促进训练和评估,创建了一个名为3D-VA-MEAD的大规模数据集,其中包含自动VA标注和3D面部运动重建。 AI
影响 这项研究通过实现由音频驱动的更细致、可控的情感动画,推动了富有表现力的AI化身领域的发展。
排序理由 该集群描述了一篇详细介绍用于3D说话人头生成的新颖框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →