PulseAugur
实时 08:15:21
English(EN) AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

新框架AffordAny可实现单张图像的3D可供性识别

研究人员开发了AffordAny,一个用于开放世界3D可供性识别的新型框架,该框架使用单目RGB图像。该系统构建了大规模文本条件3D部件监督,并通过引导式解码器进行可供性识别,通过伪标签自训练提高了泛化能力。AffordAny创建了一个包含超过5000个对象和10000个部件级样本的基准,与先前的方法相比,显著扩展了类别多样性。该框架展示了有效性和鲁棒性,在未见过对象和类别上取得了强劲的性能。 AI

影响 这项研究推动了从单张图像进行开放世界3D理解,可能改进机器人和AR/VR应用。

排序理由 该集群描述了一篇详细介绍新型3D可供性识别框架的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架AffordAny可实现单张图像的3D可供性识别

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua ·

    AffordAny:通过视觉-语言引导的几何推理,从单目RGB图像实现开放世界3D可供性识别

    arXiv:2608.20720v1 Announce Type: new Abstract: Open-world 3D affordance grounding requires localizing functional object parts in 3D given free-form language queries. Existing methods typically assume pre-built object-centric 3D geometry and closed affordance ontologies, limiting…