研究人员开发了一种新的基于骨骼的零样本时空动作定位预训练策略,旨在无需大量标注即可识别视频中未见过的动作。该方法称为骨骼-语言特征池切换(Skeleton-Language feature Pooling Switching),使用弱监督的视觉-语言预训练机制来对齐骨骼特征和文本嵌入。它还在MIL框架内结合了场景混合判别性对比学习(Scene-Mixed Discriminative Contrastive Learning),以区分实例级别的动作。在四个数据集上的实验表明,该方法有效地缓解了标注成本的限制。 AI
影响 这项研究通过减少对详细动作标注的需求,可以提高视频分析系统的效率。
排序理由 关于动作定位新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- MIL framework
- Scene-Mixed Discriminative Contrastive Learning
- Skeleton-Language feature Pooling Switching
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →