研究人员推出MegaAvatar,一个用于生成可控说话头像的新框架。该系统基于Wan2.2-TI2V-5B模型,并结合了源自SMPL-X数据的3D引导来控制身体姿势和头部运动。MegaAvatar还具有增强的音频和面部交叉注意力模块,用于精确的面部表情控制和身份保持,从而实现高质量的头像生成,并同步语音和保持身份一致性。 AI
影响 该框架有望增强各种应用中逼真且可控的虚拟头像的创建,从游戏到虚拟会议。
排序理由 研究论文,详细介绍了一个新的模型/框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →