两篇新研究论文介绍了零样本骨架动作识别(ZSAR)的新方法,该任务旨在根据骨骼运动和文本描述识别未见过的动作。第一篇论文 TDSM-MM 利用多模态三元组扩散模型,该模型整合了 RGB 视觉线索作为稳定锚点,以改进骨骼数据重建和分类。第二篇论文 GenPrior 利用预训练的 Text-to-Motion 模型的生成先验来弥合语义-运动学鸿沟,优化类别原型,并在基准数据集上取得了最先进的成果。 AI
影响 这些在零样本骨架动作识别方面的新颖方法可以增强 AI 在复杂、未见场景中理解和解释人类运动的能力。
排序理由 两篇在 arXiv 上发表的学术论文,详细介绍了骨架动作识别的新方法。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- GenPrior
- NTU-120
- NTU-60
- PKU-MMD
- Text-to-Motion (T2M)
- Dispersion-Gated Feature Fusion
- Generative Prototype Refinement
- Hugging Face
- Multimodal Triplet Diffusion for Skeleton-Text Matching
- NTU-60/120
- Skeleton Action Recognition Based on Multi-Stream Spatial Attention Graph Convolutional SRU Network
- TDSM-MM
- Zsar
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →