研究人员开发了一种新的几何测量方法,用于量化语音驱动的3D面部动画中的协发音(即周围声音对语音发音的影响)。这种称为唇部路径长度的测量方法将实际运动轨迹与音位位置之间的最短路径进行比较。当应用于四种领先的动画方法——DiffPoseTalk、ARTalk、FaceFormer和CodeTalker——时,发现所有方法都比真实语音简化了唇部轨迹,其中三种方法显示出明显的缺陷。一项包含超过3500次判断的观看者研究证实,观看者更喜欢真实语音,并对夸张或过于简化的唇部运动进行惩罚,这突显了合成发音的一个关键改进领域。 AI
影响 识别出语音驱动动画中特定的感知缺陷,为未来的模型开发提供了目标。
排序理由 介绍新方法和评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- ARTalk
- arXiv
- DiffPoseTalk
- FaceFormer
- Przemyslaw Musialski
- The Shape of Speech: A Geometric Measure of Coarticulation for Speech-Driven 3D Facial Animation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →