研究人员开发了新的对话语音合成框架,该框架能够结合面部表情和多人交互。一种名为FacialTalker的方法,使用大型语言模型骨干和在动作单元上训练的视觉标记器,以生成与面部线索一致的富有表现力的语音。另一种名为InterTalk的方法,专注于灵活、自然、高效的多参与者说话人脸视频生成,支持具有连贯的非语言反馈的实时交互。 AI
影响 这些进步可能带来更自然、更具吸引力的人机交互,从而改进虚拟助手和远程呈现。
排序理由 该集群包含两篇研究论文,详细介绍了对话式AI的新模型和技术。
- Action Units
- AUTokenizer
- DualDPO
- FacialTalker
- VSDD-1K
- Baiqin Wang
- Conversational Speech Synthesis
- Facial Expressions
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →