KIT-ML
PulseAugur coverage of KIT-ML — every cluster mentioning KIT-ML across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
BiMoGen框架使用扩散实现双向运动-文本生成
研究人员开发了BiMoGen,一个利用掩码离散扩散的双向运动-文本生成新框架。该方法通过实现迭代式双向预测,克服了先前自回归模型的局限性,从而更好地捕捉语言和运动之间的依赖关系。该框架包含一个两阶段的训练过程,包括解耦的单模态和跨模态训练以实现初始对应,以及生成感知的自纠正以在推理过程中优化预测。在HumanML3D和KIT-ML数据集上的实验表明,BiMoGen在运动到文本描述和文本到运动生成方面均取得了有竞争力的性能。
-
UniMo框架统一人类与动物3D运动生成
研究人员开发了UniMo,一个用于生成3D运动的新颖框架,该框架统一了人类和动物的运动。该系统通过将参数化骨架转换为非参数化表示来解决多样化的动物骨骼结构挑战,从而允许跨物种使用单一模型。UniMo在UniML3D上进行训练,这是一个包含超过145,000个运动序列和433,000个字幕的大规模数据集,其规模远大于现有的动物运动数据集。这种方法在多个基准测试中取得了最先进的结果,展示了有效统一的人类-动物运动生成能力。
-
ReMoMask-2 通过结构感知检索推进文本到运动生成
研究人员推出 ReMoMask-2,一个旨在通过解决检索和融合机制中的挑战来增强文本到运动生成的新框架。该系统采用分层双向动量来对齐全局和部件级特征与文本,语义时空注意力来进行拓扑感知融合,以及拓扑结构掩码来实现鲁棒的接地。ReMoMask-2 通过在生成器的潜在空间中重建检索数据库并对齐文本查询(通过蒸馏投影仪),从而实现对检索到的运动语义的直接消费,进一步改进了其前代产品。
-
ReMoMask-2 通过潜在检索推进文本到运动生成
研究人员推出了 ReMoMask-2,这是文本到运动生成领域的一项进展,它将检索直接嵌入到生成器的潜在空间中。这种方法通过允许生成器直接利用检索到的运动数据来解决先前模型中存在的表示差距。ReMoMask-2 基于 ReMoMask,后者采用了分层对比学习和拓扑感知融合来提高运动生成的准确性和结构。在 HumanML3D、KIT-ML 和 SnapMoGen 等基准数据集上的实验表明,ReMoMask-2 取得了最先进的成果,包括更低…
-
新的DeMoDiff模型通过部件级控制增强了人体运动生成
研究人员开发了一个名为DeMoDiff的新框架,用于生成人体运动。该模型通过使用时空变分自编码器来编码单个身体关节,而不是将整个运动压缩到单个潜在空间中,从而解决了现有方法的局限性。这种方法增强了表示提取能力,并允许对特定身体部位进行更大的控制。DeMoDiff还在自回归扩散生成器中融入了时空掩码和注意力机制,以提高生成质量和可编辑性。在HumanML3D和KIT-ML数据集上的实验表明,DeMoDiff在重建和运动生成方面取得了最先…
-
WaMo框架通过小波分析增强文本-运动检索 · arXiv cs.CV
研究人员开发了WaMo,一个用于文本-运动检索的新框架,该框架使用小波分解来分析3D运动序列。该方法在多个分辨率下捕捉特定关节和随时间变化的运动细节,从而改善了运动数据和文本描述之间的对齐。WaMo在HumanML3D和KIT-ML数据集上分别实现了17.0%和18.2%的相对性能提升,超越了当前最先进的方法。
-
新DC-Motion框架通过文本生成逼真人体运动
研究人员开发了DC-Motion,一个用于从文本生成人体运动的新颖框架。该方法使用离散和连续令牌的组合,将语义含义与细粒度的物理细节分离开来。首先,一个离散-连续VAE将运动分解为离散的语义令牌和连续的动态残差。随后,一个掩码自回归模型解释文本以预测离散结构,而一个扩散模型则重建连续的物理细节。实验表明,DC-Motion在遵循复杂指令方面表现出色,并在HumanML3D和KIT-ML等数据集上实现了运动逼真度和文本对齐的最新性能。
-
新的AI模型实时生成高质量3D人体运动
研究人员开发了新的基于Transformer的框架,用于从文本生成高质量的3D人体运动。MOGO利用分层向量量化和单通道因果Transformer进行实时生成,展示了具有竞争力的质量和改进的性能。MotionHiFlow采用分层流匹配方法,逐步从粗粒度语义生成运动到精细的时间细节,并结合了跨尺度转换和显式结构建模以实现精确对齐。