研究人员推出了一种新颖的端到端 Transformer 模型 HOPformer,用于自主式 3D 手部-物体姿态估计。该模型通过一次性预测手部和物体姿态,并利用交叉注意力将物体特征条件化于手部先验信息,从而提高了鲁棒性。为了促进这项研究,该团队还发布了 EPIC-Contact,这是一个包含 2.3K 个自主式真实场景片段的新数据集,具有详细的 3D 手部-物体接触对应关系和姿态网格。HOPformer 在现有数据集和新数据集上均展现出显著的性能提升,在 EPIC-Contact 上的成功率几乎翻倍。 AI
影响 推动了自主式 3D 计算机视觉能力的发展,可能改进机器人和增强现实应用。
排序理由 该集群描述了一篇关于针对特定计算机视觉任务的新模型和数据集的最新研究论文。
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →