PulseAugur
实时 11:01:08
English(EN) Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

Xemo-Talker系统解锁音频驱动说话人像中的显式情感控制

研究人员开发了Xemo-Talker,一个用于生成具有显式情感控制的音频驱动说话人像的新颖系统。该系统通过将监督集中在编码情感线索而非主要发音的运动的次要分量上,解决了精确唇同步与细粒度情感表达之间平衡的挑战。Xemo-Talker在保持具有竞争力的唇同步和高推理效率的同时,实现了最先进的情感分类准确性,其源代码可在Hugging Face上获取。 AI

影响 这项研究可能为虚拟通信和娱乐领域带来更具表现力和可控性的AI生成头像。

排序理由 该集群包含一篇详细介绍音频驱动说话人像合成新模型的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Xemo-Talker系统解锁音频驱动说话人像中的显式情感控制

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Chaolong Yang, Yinuo Guo, Kai Yao, Yuyao Yan, Jie Sun, Guangliang Cheng, Shibin Wu, Bin Dong, Kaizhu Huang ·

    Xemo-Talker:显式解锁情感以实现音频驱动的说话人像合成

    arXiv:2608.14700v1 Announce Type: new Abstract: Precise emotion control in audio-driven talking heads remains a challenge due to the reliance on implicit emotion regulation in existing systems, which often leads to indirect and insufficient control. Additionally, training with ex…