研究人员开发了EMODY Flow,一个用于生成与语音和情感线索同步的全身运动的新颖框架。该系统解决了现有模型中情感条件化经常被低估的局限性。EMODY Flow是一个拥有约3500万参数的轻量级模型,与冻结的Qwen-3 Omni模型集成,并利用其Mimi音频编解码器。它采用两个并行的Diffusion Transformer (DiT) 生成器来生成身体姿势和面部表情,并通过一个辅助情感分类器进行增强,以确保生成运动中独特的情感表达。该框架在BEAT2数据集上实现了手势质量、相关性和多样性的最先进结果,显著优于以前的方法。 AI
影响 通过实现由音频驱动的更具表现力和情感共鸣的角色动画,推动了具身AI的发展。
排序理由 学术论文,详细介绍了一个新模型及其在基准测试上的表现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →