研究人员开发了Xemo-Talker,一个用于生成具有显式情感控制的音频驱动说话人像的新颖系统。该系统通过将监督集中在编码情感线索而非主要发音的运动的次要分量上,解决了精确唇同步与细粒度情感表达之间平衡的挑战。Xemo-Talker在保持具有竞争力的唇同步和高推理效率的同时,实现了最先进的情感分类准确性,其源代码可在Hugging Face上获取。 AI
影响 这项研究可能为虚拟通信和娱乐领域带来更具表现力和可控性的AI生成头像。
排序理由 该集群包含一篇详细介绍音频驱动说话人像合成新模型的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →