研究人员开发了MoVT,一个旨在通过利用大量人类动作视频数据来改进文本到3D人类运动生成的新框架。MoVT的核心是一个跨模态增强运动标记器,它将3D运动标记投影到2D域,用视频中的真实世界模式丰富运动代码本。然后,这些增强的代码本被集成到一个生成式掩码Transformer中,实现运动标记索引的模态无关预测。这种方法允许使用从2D代码本和带注释的运动视频派生的文本-索引对来进一步优化生成器,在实证评估中优于现有的最先进方法。 AI
影响 这项研究可能导致由文本提示驱动的更复杂、更自然的3D角色动画。
排序理由 该集群包含一篇详细介绍文本到运动生成新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →