研究人员推出了新的框架和基准来理解计算机视觉中的手部-物体交互。一篇论文详细介绍了 HOI-DETR,这是一种新的架构,在 Hands23 和 FineBio 等多个数据集上将最先进的性能提高了 20 多个百分点。另一项贡献是 HanDyVQA,这是一个视频问答基准,旨在评估手部-物体动态中的细粒度时空推理能力,而当前的 Gemini 2.5 Pro 等模型难以掌握。 AI
影响 新的基准和模型推动了对复杂人-物体交互理解的前沿研究,有望改进机器人技术和动作识别。
排序理由 该集群包含两篇学术论文,详细介绍了用于计算机视觉任务的新模型和基准。
- arXiv
- Gemini 2.5 Pro
- HanDyVQA
- Masatoshi Tateno
- Ahamd Darkhalil
- FineBio
- Hands23
- HD-EPIC
- HOI-DETR
- HOIST
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →