研究人员开发了SoundMHPE,一个仅使用声音即可估算多人三维姿态的新型框架。该方法解决了多人场景中固有的声学信号重叠和人与人之间反射的挑战。该系统利用声学多尺度编码器提取细微的声学特征,并利用具有注意力机制的时间姿态解码器来解开跨帧的个体姿态。为了支持这项研究,创建了一个名为AMP的6小时新数据集,其中包含同步的多人姿态和声学数据。 AI
影响 这项研究可能为在视觉数据不可用或受限的情况下进行人机交互和监控带来新方法。
排序理由 该集群描述了一篇新颖的研究论文,详细介绍了一个用于特定计算机视觉任务的新AI框架和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
- Acoustic Multi-person Pose (AMP) dataset
- Acoustic Multi-scale Encoder
- arXiv
- SoundMHPE
- Temporal Pose Decoder
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →