HumanML3D
PulseAugur coverage of HumanML3D — every cluster mentioning HumanML3D across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的DeMoDiff模型通过部件级控制增强了人体运动生成
研究人员开发了一个名为DeMoDiff的新框架,用于生成人体运动。该模型通过使用时空变分自编码器来编码单个身体关节,而不是将整个运动压缩到单个潜在空间中,从而解决了现有方法的局限性。这种方法增强了表示提取能力,并允许对特定身体部位进行更大的控制。DeMoDiff还在自回归扩散生成器中融入了时空掩码和注意力机制,以提高生成质量和可编辑性。在HumanML3D和KIT-ML数据集上的实验表明,DeMoDiff在重建和运动生成方面取得了最先…
-
在 MotionGPT3 中,修正流在文本到运动生成方面优于扩散模型
研究人员在 MotionGPT3 框架内,对文本驱动的运动生成任务中的扩散模型和修正流目标进行了比较研究。在 HumanML3D 数据集上进行的实验表明,修正流收敛速度更快,早期就能达到强劲性能,并且在相同条件下,其运动质量与基于扩散的模型相当或更优。此外,基于流的先验模型在效率-质量权衡方面表现更好,所需的采样步数更少,这表明修正流的优势也延伸到了连续潜在文本到运动生成。
-
WaMo框架通过小波分析增强文本-运动检索 · arXiv cs.CV
研究人员开发了WaMo,一个用于文本-运动检索的新框架,该框架使用小波分解来分析3D运动序列。该方法在多个分辨率下捕捉特定关节和随时间变化的运动细节,从而改善了运动数据和文本描述之间的对齐。WaMo在HumanML3D和KIT-ML数据集上分别实现了17.0%和18.2%的相对性能提升,超越了当前最先进的方法。
-
MUGEN框架通过连续潜在变量统一运动理解和生成
研究人员推出MUGEN,一个新颖的统一框架,旨在实现高效的运动理解和生成。与依赖离散运动码本的先前方法不同,MUGEN利用从连续潜在槽中进行的一次抽取,消除了量化限制并提高了生成质量。这种方法允许单个自适应长度的自编码器压缩不同长度的运动,而语言模型生成的潜在变量可用于文本到运动生成和运动到文本理解任务。MUGEN在HumanML3D和SnapMoGen等基准测试中,在FID、检索精度、CIDEr和BLEU@4等各种指标上均展现出最先…
-
新框架KineMIC增强了HAR的少样本动作合成
研究人员开发了KineMIC,一个新颖的迁移学习框架,旨在通过利用CLIP文本嵌入进行运动蒸馏,来改进基于骨骼的人类活动识别(HAR)的少样本动作合成。该方法将通常为通用艺术动作训练的文本到运动扩散模型,适配到HAR的特定需求。通过仅使用NTU RGB+D 120数据集中的每个动作类别10个样本,KineMIC显著提高了运动连贯性,并提供了强大的数据增强来源,使HAR分类器的准确性提高了23.1%。
-
ScaleMoGen框架推动文本驱动的人体运动生成
研究人员推出了一种新颖的框架ScaleMoGen,用于根据文本描述生成人体运动。该方法采用自回归方法,可以预测多尺度的运动令牌,从粗略到精细,确保保留骨骼层次结构和运动细节。ScaleMoGen在HumanML3D和SnapMoGen等基准测试中展现了最先进的性能,在FID和CLIP分数方面优于MoMask和MoMask++等现有方法。该框架还支持高效、无需训练的生成运动编辑。
-
新研究精炼扩散模型噪声以更好地控制视频生成
两篇新研究论文提出了通过操纵初始噪声输入来提高基于扩散的视频生成可控性的新方法。第一篇论文 WINRO 专注于文本到运动生成,通过检索和精炼承载潜在语义结构的“获胜噪声票据”,在不重新训练基础模型的情况下增强文本-运动对齐。第二篇论文 UniCaMo 通过构建共享的 3D 接地运动一致噪声空间来解决可控视频生成问题,通过噪声变形和球形采样实现对对象和相机运动的同时控制,并通过轻量级 LoRA 微调实现最先进的结果。
-
新的Transformer分词器利用语言改进人类运动生成
研究人员开发了一种新颖的语言引导分词器(LG-Tok),用于生成人类运动,它将原始运动数据转换为紧凑、语义丰富的标记。该方法使用基于Transformer的分词器将自然语言与运动对齐,简化了生成模型的学习过程并提高了重建质量。LG-Tok在HumanML3D和Motion-X等基准测试中表现出色,在质量和效率方面均优于现有最先进的方法,即使使用的标记更少。
-
新研究解决可动部件物体运动生成与建模问题
两篇新研究论文 PWM-ArtGen 和 SAMoR 介绍了生成和建模可动部件物体运动的新方法。PWM-ArtGen 通过学习视觉动力学和运动学参数的联合分布,利用部件世界模型并在未标注数据上进行协同训练,专注于从单个图像预测物体的运动学结构。SAMoR 通过开发一种跨拓扑运动表示,将运动片段编码为共享部件标记,解决了具有任意骨架和拓扑的物体运动建模的挑战,在重建方面优于现有基线,并支持文本条件生成。
-
新研究解决扩散模型效率和应用问题 · 追踪8个来源
近期研究探索了扩散模型的进展,重点在于提高其效率和在各个领域的适用性。FlashDiff 引入了自适应区域执行和调度,以降低图像、视频和音频生成的服务延迟并提高吞吐量。视频扩散模型中存在“序列性差距”挑战,即性能会随着因果链的延长而下降,这表明需要改进序列计算。其他工作提出了使用检索增强扩散 Transformer 进行异步时间序列预测的 ReDiTT,并探索了无需重新训练即可提高扩散模型多样性的方差校正时间偏移。此外,Singula…
-
新的 LoRA 变体增强了运动语言智能体的持续学习能力
研究人员开发了新的低秩自适应 (LoRA) 变体,以提高运动语言智能体的持续学习能力。这些智能体需要理解和生成文本中的人类运动,而不会忘记先前学到的技能。所提出的混合专家架构使用基于自动编码器的路由器,在不需要任务标签的情况下选择特定任务的专家。在源自 HumanML3D 的五任务基准测试上的实验表明,在保持运动到文本和文本到运动任务的高质量的同时,遗忘率接近于零。
-
新DC-Motion框架通过文本生成逼真人体运动
研究人员开发了DC-Motion,一个用于从文本生成人体运动的新颖框架。该方法使用离散和连续令牌的组合,将语义含义与细粒度的物理细节分离开来。首先,一个离散-连续VAE将运动分解为离散的语义令牌和连续的动态残差。随后,一个掩码自回归模型解释文本以预测离散结构,而一个扩散模型则重建连续的物理细节。实验表明,DC-Motion在遵循复杂指令方面表现出色,并在HumanML3D和KIT-ML等数据集上实现了运动逼真度和文本对齐的最新性能。
-
VideoMDM 从 2D 视频生成 3D 人体运动,无需 3D 真实数据
研究人员开发了 VideoMDM,一个新颖的基于扩散的框架,用于从 2D 视频监督生成 3D 人体运动。该方法直接从 2D 姿势中训练 3D 运动先验,无需显式的 3D 真实数据。通过使用预训练的 2D 到 3D 提升器作为噪声教师,并采用深度加权 2D 重投影损失,VideoMDM 在 HumanML3D 等基准测试上取得了接近完全 3D 监督模型的性能。该框架还在 Fit3D 和 NBA 等真实视频数据集上取得了成功,生成的运动更…
-
新方法将人类运动转换为文本以供LLM分析
研究人员开发了一种名为结构化运动描述(SMD)的新方法,该方法将人类运动数据转换为自然语言文本。这种方法通过将关节角度和身体运动学表示为描述性文本,绕过了对专用编码器的需求,从而使大型语言模型(LLM)能够直接处理和推理人类运动。SMD在运动问答和运动描述任务上已展示出最先进的性能,优于以往的方法,并提供了可解释性和与各种LLM兼容性等优势,只需少量调整。
-
新AI模型生成具有精确轨迹控制的逼真人体运动
研究人员开发了新的方法来生成逼真的人体运动,使其能够准确地遵循指定的轨迹和文本描述。一种方法CMC采用两阶段扩散过程,首先确保轨迹依从性,然后完成全身运动,并结合选择性修复机制来改进训练。另一种方法MSCoT采用多尺度、粗到精的策略,结合高效的token引导和细化模块,以实现更快、更精确的控制。第三个框架AnchorRoute使用稀疏锚点作为生成和细化的支架,将扩散先验与基于残差的细化求解器相结合,以提高控制精度同时保持运动质量。
-
新方法使用超网络从文本生成风格化人体运动
研究人员开发了一个新颖的框架,用于从文本描述生成风格化的人体运动,解决了当前文本到运动模型的局限性。他们的方法利用超网络在扩散过程中动态调整低秩适配(LoRA)参数,从而在无需大量微调的情况下实现高效和泛化的风格化。该方法能有效捕捉多样化的风格属性,并提高在未见过风格上的性能,在基准数据集上优于现有的最先进技术。
-
新的AI模型实时生成高质量3D人体运动
研究人员开发了新的基于Transformer的框架,用于从文本生成高质量的3D人体运动。MOGO利用分层向量量化和单通道因果Transformer进行实时生成,展示了具有竞争力的质量和改进的性能。MotionHiFlow采用分层流匹配方法,逐步从粗粒度语义生成运动到精细的时间细节,并结合了跨尺度转换和显式结构建模以实现精确对齐。
-
新方法使用LLM实现无编码器的人类运动理解
研究人员开发了一种名为结构化运动描述(SMD)的新颖方法,利用大型语言模型(LLM)来理解人类运动。与先前需要专用编码器来对齐运动数据与LLM嵌入的方法不同,SMD将关节位置序列转换为结构化的自然语言描述。这种基于文本的表示形式使LLM能够利用其现有知识进行运动推理,而无需专门的对齐模块。SMD方法在运动问答和运动字幕生成任务中展示了最先进的性能,同时还提供了跨LLM兼容性(只需少量调整即可)和可解释分析等优势。