NTU RGB+D 120: A Large-Scale Benchmark for 3D Human Activity Understanding
PulseAugur coverage of NTU RGB+D 120: A Large-Scale Benchmark for 3D Human Activity Understanding — every cluster mentioning NTU RGB+D 120: A Large-Scale Benchmark for 3D Human Activity Understanding across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架KineMIC增强了HAR的少样本动作合成
研究人员开发了KineMIC,一个新颖的迁移学习框架,旨在通过利用CLIP文本嵌入进行运动蒸馏,来改进基于骨骼的人类活动识别(HAR)的少样本动作合成。该方法将通常为通用艺术动作训练的文本到运动扩散模型,适配到HAR的特定需求。通过仅使用NTU RGB+D 120数据集中的每个动作类别10个样本,KineMIC显著提高了运动连贯性,并提供了强大的数据增强来源,使HAR分类器的准确性提高了23.1%。
-
新的超图框架通过部分骨架数据提升动作识别能力
研究人员开发了PartialVisGraph,一个旨在改善有限视场场景下基于骨架的动作识别的新型超图框架。该方法解决了在现实应用(如监控或机器人技术)中常见的关节遮挡或视场外问题导致的性能下降问题。该框架利用可学习的虚拟超边和自适应Transformer来聚合关节特征,同时整合可见性先验,过滤掉来自被遮挡关节的不可靠信息。在基准数据集上的实验表明,在部分可见性条件下,准确率显著提高,最高可达68.8%。
-
New Attack Method Preserves Motion Quality in Skeleton Action Recognition
研究人员开发了一种新的方法,用于对基于骨骼的人体动作识别系统进行不可感知对抗性攻击。与先前引入明显扰动的方法不同,这种方法旨在保持运动数据的自然性。新技术使用基于分布的对抗性攻击和一种新颖的运动质量评估指标,该指标据称与人类感知更一致。实验表明,该方法在成功攻击动作识别器和保持修改后运动数据的质量方面都有效,引发了对当前系统鲁棒性的担忧。
-
BioVid 生成具有自然行为时序的视频
研究人员开发了 BioVid,一个新颖的自回归视频生成框架,它学习生成反映生物行为自然时序结构的视频。与依赖固定帧数或外部提示的现有方法不同,BioVid 的模型在行为事件达到语义闭合时学习发出序列结束标记。这种方法使得生成的视频长度能够与真实数据分布紧密匹配,在人类饮水行为数据集上的实验证明了这一点。
-
新框架使用超bolic 几何进行基于骨骼的动作识别
研究人员开发了 SkelHCC,一个用于基于骨骼数据的单次动作识别的新框架。该方法利用超bolic 几何来更好地模拟人类运动的层次结构并将其与语言语义对齐。该框架还包含一个由 LLM 引导的缓存,用于高效推理,并在基准数据集上展示了卓越的性能。
-
新框架为视频分类器生成反事实解释
研究人员开发了一个名为 Back To The Feature (BTTF) 的新框架,用于为视频分类器生成反事实解释。与之前专注于图像的方法不同,BTTF 解决了视频解释的独特挑战,确保其合理性、时间连贯性和运动平滑性。该框架使用一种新颖的优化方案和两阶段策略,在仅由目标分类器指导以确保忠实性的情况下,找到接近原始输入的反事实视频。在运动、情感和动作分类数据集上的实验表明,BTTF 能够生成逼真的反事实视频,从而深入了解分类器的决策过程。
-
新方法利用多视角运动和文本改进零样本动作识别
研究人员开发了一种新的零样本动作识别方法,提高了对领域变化的鲁棒性。该方法结合了来自多个摄像机视点的运动数据和动作的文本描述。这种面向方向的系统增强了对新颖动作-运动组合的泛化能力,在多个基准测试中表现优于现有的最先进方法。
-
面向零样本骨骼动作识别的增强扩散模型
研究人员开发了一种名为“面向骨骼-文本匹配的频率感知扩散模型”(FDSM)的新方法,以改进零样本骨骼动作识别。该方法解决了扩散模型中可能导致运动动态过度平滑的光谱偏差问题。FDSM 结合了语义引导的光谱残差学习和时间步长自适应光谱损失模块,以及基于课程的语义抽象,以更好地捕捉细粒度的运动细节。该方法在多个基准数据集上取得了最先进的结果。
-
新的对比学习方法改进了基于骨架的动作定位
研究人员开发了一种名为骨架-片段对比学习(Skeleton-Snippet Contrastive Learning)的新型自监督预训练方法,用于改进基于骨架数据的时序动作定位。该方法使用片段判别任务来学习区分相邻帧的特征,这对于识别动作边界至关重要。该方法还包含一个U型模块来融合中间特征,提高帧级定位的分辨率。实验结果表明,在BABEL数据集上性能有所提升,并在PKUMMD数据集上取得了最先进的迁移学习结果。