3D pose estimation
PulseAugur coverage of 3D pose estimation — every cluster mentioning 3D pose estimation across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的WiSPER框架使用WiFi CSI增强多人体3D姿态估计
研究人员开发了WiSPER,一个使用WiFi信道状态信息(CSI)进行多人体3D姿态估计的新型两阶段框架。该系统采用姿态感知的预测预训练和条件残差流细化来提高准确性。在PiW3D数据集上的实验证明了WiSPER的有效性,实现了63.72毫米的平均每关节位置误差,与WiFi-JEPA等现有方法相比有了显著降低。
-
New EGGroW algorithms unlock efficient geodesic Gromov-Wasserstein distances for 3D modeling
研究人员开发了EGGroW,一类新颖的算法,旨在高效计算测地Gromov-Wasserstein距离。这些距离对于比较不同度量空间中的概率分布至关重要,并应用于3D姿态估计和模板检测等领域。EGGroW利用熵汇集(Sinkhorn-like)方法和随机特征来克服先前方法的计算限制,在欧几里得方法失效的地方提供准确的解决方案。
-
新的蒸馏方法改进了婴儿3D姿态估计
研究人员开发了一种通过跨模型蒸馏来改进婴儿3D人体姿态估计的方法。通过在无标注的婴儿视频上训练SAM 3D Body模型,他们能够从Sapiens 2姿态模型转移知识。这种微调过程提高了2D关键点检测和3D姿态恢复的准确性,展示了婴儿无标记运动捕捉的显著改进。
-
新型毫米波-语言模型mmMind弥合了雷达传感与大语言模型之间的差距
研究人员开发了mmMind,这是一种新颖的雷达-语言模型,旨在使大型语言模型能够理解物理空间中的人类行为。该模型在训练期间利用同步的3D姿态数据作为监督,使其在推理时仅凭毫米波雷达信号就能捕捉身体配置和运动动态。为了评估其有效性,研究团队还推出了mmMind-Bench,这是一个包含17.9小时真实世界录音的基准数据集。实验表明,在行为字幕和问答等任务中,mmMind的性能显著优于现有的雷达-语言基线,并且消融研究证实了姿态引导预训练的关键作用。
-
VARPose 通过自回归建模增强二维姿态估计
研究人员推出 VARPose,一种通过自适应致密化稀疏姿态来增强二维人体姿态估计的新方法。该技术利用视觉自回归建模 (VAR) 和粒度无关姿态分词器 (GPT) 来创建统一的多尺度离散姿态表示。然后,UniSkelar 模型以粗到精的方式预测用于增加姿态密度的分词序列,从而改进三维姿态估计和人体网格恢复等下游任务。
-
AI流水线从智能手机视频中测量患者运动
研究人员开发了定量运动测试(QMT),一种计算机视觉流水线,可从标准的智能手机视频中提取3D运动学生物标志物。该方法使用基于深度学习的3D姿态估计,为昂贵的基于实验室的运动捕捉系统提供了一种更易于访问和客观的替代方案。QMT已显示出与黄金标准方法的高度一致性,并有望在临床试验中跟踪疾病进展和治疗反应,特别是在慢性疼痛疾病方面。
-
研究人员开发新方法分析体育运动中的全身协调性
研究人员开发了一种名为复希尔伯特主成分分析(CHPCA)的新方法,利用无标记3D姿态估算数据来分析体育运动中的全身协调性。该技术可自动分割运动阶段,并将分析扩展到身体表面网格顶点,将运动链表示为连续相位场。该框架揭示了以躯干为锚定的全局相位结构,并量化了准备和执行阶段之间的功能不对称性,从而弥合了运动的运动学和动力学描述。