PulseAugur
中
实时 05:51:44
实体 HumanML3D

HumanML3D

PulseAugur coverage of HumanML3D — every cluster mentioning HumanML3D across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
26
90 天内 26
发布 · 30天
0
90 天内 0
论文 · 30天
26
90 天内 26
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 26 条
  1. TOOL · CL_287247 ·

    BiPO网络以双向方法推进文本到动作合成

    研究人员开发了BiPO,一个双向部分遮挡网络(Bidirectional Partial Occlusion Network),旨在改进文本到动作合成。这个新颖的模型集成了基于部分的生成与双向自回归架构,使其能够考虑过去和未来的动作上下文,同时提供对个体身体部位的详细控制。BiPO还采用了一种部分遮挡技术,在训练过程中概率性地遮蔽动作信息,从而增强其从文本描述生成自然且富有表现力的人类动作的能力。实验表明,BiPO在HumanML3D…

  2. TOOL · CL_280092 ·

    新的TACD方法训练高效文本到运动模型

    研究人员开发了一种名为终端放大控制蒸馏(TACD)的新方法,以创建更高效的文本到运动模型。这种on-policy方法使用文本提示和现有的教师模型来训练更小的运动生成器,而无需真实的运动训练数据。TACD通过动态调整监督权重来解决少步生成中的一种失效模式,从而在HumanML3D和KIT-ML等基准测试中提高了性能,并显著减少了生成时间和内存使用量。

  3. TOOL · CL_275510 ·

    FloodDiffusion 2 以效率和路径控制推进流式运动生成

    研究人员推出了 FloodDiffusion 2 (FD2),一个专为高效且可控的流式运动生成设计的先进框架。该新模型在前代 FloodDiffusion (FD1) 的基础上,解决了效率和精确轨迹控制方面的局限性。FD2 采用了部分注意力机制以加快推理和训练速度,使用 Bregman 准则进行回归损失以保持运动质量,并结合精确的路径条件来引导角色沿期望轨迹移动。这些改进显著减少了训练计算和去噪时间,并在 SEED 和 HumanML…

  4. TOOL · CL_275254 ·

    新的三角重采样方法改进了长时程运动生成

    研究人员开发了三角重采样(TR)技术,这是一种新颖的训练后技术,旨在提高运动扩散模型在长序列上的准确性。该方法通过将基于滚动的训练扩展到部分去噪状态,并使用真实值钳位来防止过度漂移,从而解决了误差累积问题。在HumanML3D数据集上的实验表明,TR在120秒运动生成任务中显著降低了误差和退化,取得了最先进的结果。

  5. TOOL · CL_269466 ·

    BiMoGen框架使用扩散实现双向运动-文本生成

    研究人员开发了BiMoGen,一个利用掩码离散扩散的双向运动-文本生成新框架。该方法通过实现迭代式双向预测,克服了先前自回归模型的局限性,从而更好地捕捉语言和运动之间的依赖关系。该框架包含一个两阶段的训练过程,包括解耦的单模态和跨模态训练以实现初始对应,以及生成感知的自纠正以在推理过程中优化预测。在HumanML3D和KIT-ML数据集上的实验表明,BiMoGen在运动到文本描述和文本到运动生成方面均取得了有竞争力的性能。

  6. TOOL · CL_252208 ·

    UniMo框架统一人类与动物3D运动生成

    研究人员开发了UniMo,一个用于生成3D运动的新颖框架,该框架统一了人类和动物的运动。该系统通过将参数化骨架转换为非参数化表示来解决多样化的动物骨骼结构挑战,从而允许跨物种使用单一模型。UniMo在UniML3D上进行训练,这是一个包含超过145,000个运动序列和433,000个字幕的大规模数据集,其规模远大于现有的动物运动数据集。这种方法在多个基准测试中取得了最先进的结果,展示了有效统一的人类-动物运动生成能力。

  7. TOOL · CL_243430 ·

    ReMoMask-2 通过结构感知检索推进文本到运动生成

    研究人员推出 ReMoMask-2,一个旨在通过解决检索和融合机制中的挑战来增强文本到运动生成的新框架。该系统采用分层双向动量来对齐全局和部件级特征与文本,语义时空注意力来进行拓扑感知融合,以及拓扑结构掩码来实现鲁棒的接地。ReMoMask-2 通过在生成器的潜在空间中重建检索数据库并对齐文本查询(通过蒸馏投影仪),从而实现对检索到的运动语义的直接消费,进一步改进了其前代产品。

  8. TOOL · CL_254018 ·

    ReMoMask-2 通过潜在检索推进文本到运动生成

    研究人员推出了 ReMoMask-2,这是文本到运动生成领域的一项进展,它将检索直接嵌入到生成器的潜在空间中。这种方法通过允许生成器直接利用检索到的运动数据来解决先前模型中存在的表示差距。ReMoMask-2 基于 ReMoMask,后者采用了分层对比学习和拓扑感知融合来提高运动生成的准确性和结构。在 HumanML3D、KIT-ML 和 SnapMoGen 等基准数据集上的实验表明,ReMoMask-2 取得了最先进的成果,包括更低…

  9. TOOL · CL_218313 ·

    新的DeMoDiff模型通过部件级控制增强了人体运动生成

    研究人员开发了一个名为DeMoDiff的新框架,用于生成人体运动。该模型通过使用时空变分自编码器来编码单个身体关节,而不是将整个运动压缩到单个潜在空间中,从而解决了现有方法的局限性。这种方法增强了表示提取能力,并允许对特定身体部位进行更大的控制。DeMoDiff还在自回归扩散生成器中融入了时空掩码和注意力机制,以提高生成质量和可编辑性。在HumanML3D和KIT-ML数据集上的实验表明,DeMoDiff在重建和运动生成方面取得了最先…

  10. TOOL · CL_208623 ·

    在 MotionGPT3 中,修正流在文本到运动生成方面优于扩散模型

    研究人员在 MotionGPT3 框架内,对文本驱动的运动生成任务中的扩散模型和修正流目标进行了比较研究。在 HumanML3D 数据集上进行的实验表明,修正流收敛速度更快,早期就能达到强劲性能,并且在相同条件下,其运动质量与基于扩散的模型相当或更优。此外,基于流的先验模型在效率-质量权衡方面表现更好,所需的采样步数更少,这表明修正流的优势也延伸到了连续潜在文本到运动生成。

  11. TOOL · CL_178572 ·

    WaMo框架通过小波分析增强文本-运动检索 · arXiv cs.CV

    研究人员开发了WaMo,一个用于文本-运动检索的新框架,该框架使用小波分解来分析3D运动序列。该方法在多个分辨率下捕捉特定关节和随时间变化的运动细节,从而改善了运动数据和文本描述之间的对齐。WaMo在HumanML3D和KIT-ML数据集上分别实现了17.0%和18.2%的相对性能提升,超越了当前最先进的方法。

  12. TOOL · CL_174144 ·

    MUGEN框架通过连续潜在变量统一运动理解和生成

    研究人员推出MUGEN,一个新颖的统一框架,旨在实现高效的运动理解和生成。与依赖离散运动码本的先前方法不同,MUGEN利用从连续潜在槽中进行的一次抽取,消除了量化限制并提高了生成质量。这种方法允许单个自适应长度的自编码器压缩不同长度的运动,而语言模型生成的潜在变量可用于文本到运动生成和运动到文本理解任务。MUGEN在HumanML3D和SnapMoGen等基准测试中,在FID、检索精度、CIDEr和BLEU@4等各种指标上均展现出最先…

  13. TOOL · CL_172058 ·

    新框架KineMIC增强了HAR的少样本动作合成

    研究人员开发了KineMIC,一个新颖的迁移学习框架,旨在通过利用CLIP文本嵌入进行运动蒸馏,来改进基于骨骼的人类活动识别(HAR)的少样本动作合成。该方法将通常为通用艺术动作训练的文本到运动扩散模型,适配到HAR的特定需求。通过仅使用NTU RGB+D 120数据集中的每个动作类别10个样本,KineMIC显著提高了运动连贯性,并提供了强大的数据增强来源,使HAR分类器的准确性提高了23.1%。

  14. TOOL · CL_156637 ·

    ScaleMoGen框架推动文本驱动的人体运动生成

    研究人员推出了一种新颖的框架ScaleMoGen,用于根据文本描述生成人体运动。该方法采用自回归方法,可以预测多尺度的运动令牌,从粗略到精细,确保保留骨骼层次结构和运动细节。ScaleMoGen在HumanML3D和SnapMoGen等基准测试中展现了最先进的性能,在FID和CLIP分数方面优于MoMask和MoMask++等现有方法。该框架还支持高效、无需训练的生成运动编辑。

  15. RESEARCH · CL_129386 ·

    新研究精炼扩散模型噪声以更好地控制视频生成

    两篇新研究论文提出了通过操纵初始噪声输入来提高基于扩散的视频生成可控性的新方法。第一篇论文 WINRO 专注于文本到运动生成,通过检索和精炼承载潜在语义结构的“获胜噪声票据”,在不重新训练基础模型的情况下增强文本-运动对齐。第二篇论文 UniCaMo 通过构建共享的 3D 接地运动一致噪声空间来解决可控视频生成问题,通过噪声变形和球形采样实现对对象和相机运动的同时控制,并通过轻量级 LoRA 微调实现最先进的结果。

  16. TOOL · CL_123364 ·

    新的Transformer分词器利用语言改进人类运动生成

    研究人员开发了一种新颖的语言引导分词器(LG-Tok),用于生成人类运动,它将原始运动数据转换为紧凑、语义丰富的标记。该方法使用基于Transformer的分词器将自然语言与运动对齐,简化了生成模型的学习过程并提高了重建质量。LG-Tok在HumanML3D和Motion-X等基准测试中表现出色,在质量和效率方面均优于现有最先进的方法,即使使用的标记更少。

  17. RESEARCH · CL_123312 ·

    新研究解决可动部件物体运动生成与建模问题

    两篇新研究论文 PWM-ArtGen 和 SAMoR 介绍了生成和建模可动部件物体运动的新方法。PWM-ArtGen 通过学习视觉动力学和运动学参数的联合分布,利用部件世界模型并在未标注数据上进行协同训练,专注于从单个图像预测物体的运动学结构。SAMoR 通过开发一种跨拓扑运动表示,将运动片段编码为共享部件标记,解决了具有任意骨架和拓扑的物体运动建模的挑战,在重建方面优于现有基线,并支持文本条件生成。

  18. RESEARCH · CL_128430 ·

    新研究解决扩散模型效率和应用问题 · 追踪8个来源

    近期研究探索了扩散模型的进展,重点在于提高其效率和在各个领域的适用性。FlashDiff 引入了自适应区域执行和调度,以降低图像、视频和音频生成的服务延迟并提高吞吐量。视频扩散模型中存在“序列性差距”挑战,即性能会随着因果链的延长而下降,这表明需要改进序列计算。其他工作提出了使用检索增强扩散 Transformer 进行异步时间序列预测的 ReDiTT,并探索了无需重新训练即可提高扩散模型多样性的方差校正时间偏移。此外,Singula…

  19. RESEARCH · CL_117282 ·

    新的 LoRA 变体增强了运动语言智能体的持续学习能力

    研究人员开发了新的低秩自适应 (LoRA) 变体,以提高运动语言智能体的持续学习能力。这些智能体需要理解和生成文本中的人类运动,而不会忘记先前学到的技能。所提出的混合专家架构使用基于自动编码器的路由器,在不需要任务标签的情况下选择特定任务的专家。在源自 HumanML3D 的五任务基准测试上的实验表明,在保持运动到文本和文本到运动任务的高质量的同时,遗忘率接近于零。

  20. TOOL · CL_93963 ·

    新DC-Motion框架通过文本生成逼真人体运动

    研究人员开发了DC-Motion,一个用于从文本生成人体运动的新颖框架。该方法使用离散和连续令牌的组合,将语义含义与细粒度的物理细节分离开来。首先,一个离散-连续VAE将运动分解为离散的语义令牌和连续的动态残差。随后,一个掩码自回归模型解释文本以预测离散结构,而一个扩散模型则重建连续的物理细节。实验表明,DC-Motion在遵循复杂指令方面表现出色,并在HumanML3D和KIT-ML等数据集上实现了运动逼真度和文本对齐的最新性能。