SnapMoGen
PulseAugur coverage of SnapMoGen — every cluster mentioning SnapMoGen across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
ReMoMask-2 通过结构感知检索推进文本到运动生成
研究人员推出 ReMoMask-2,一个旨在通过解决检索和融合机制中的挑战来增强文本到运动生成的新框架。该系统采用分层双向动量来对齐全局和部件级特征与文本,语义时空注意力来进行拓扑感知融合,以及拓扑结构掩码来实现鲁棒的接地。ReMoMask-2 通过在生成器的潜在空间中重建检索数据库并对齐文本查询(通过蒸馏投影仪),从而实现对检索到的运动语义的直接消费,进一步改进了其前代产品。
-
新框架FineMoLA通过片段级数据增强运动-语言对齐
研究人员开发了FineMoLA,一个旨在改善人体运动与文本描述之间对齐的新型框架。这种弱监督方法可以学习片段级标注中单个运动帧与特定短语之间的细粒度对应关系。通过将运动-语言对齐表述为最优传输问题,FineMoLA可以在无需手动标注的情况下推断帧级对齐,并在SnapMoGen数据集上的运动-文本基础任务中展现出卓越的性能。
-
MUGEN框架通过连续潜在变量统一运动理解和生成
研究人员推出MUGEN,一个新颖的统一框架,旨在实现高效的运动理解和生成。与依赖离散运动码本的先前方法不同,MUGEN利用从连续潜在槽中进行的一次抽取,消除了量化限制并提高了生成质量。这种方法允许单个自适应长度的自编码器压缩不同长度的运动,而语言模型生成的潜在变量可用于文本到运动生成和运动到文本理解任务。MUGEN在HumanML3D和SnapMoGen等基准测试中,在FID、检索精度、CIDEr和BLEU@4等各种指标上均展现出最先…
-
ScaleMoGen框架推动文本驱动的人体运动生成
研究人员推出了一种新颖的框架ScaleMoGen,用于根据文本描述生成人体运动。该方法采用自回归方法,可以预测多尺度的运动令牌,从粗略到精细,确保保留骨骼层次结构和运动细节。ScaleMoGen在HumanML3D和SnapMoGen等基准测试中展现了最先进的性能,在FID和CLIP分数方面优于MoMask和MoMask++等现有方法。该框架还支持高效、无需训练的生成运动编辑。