PulseAugur
实时 10:12:33

新的UTok3D分词器将CLIP适配于3D理解任务

研究人员开发了UTok3D,一个新颖的参数高效框架,旨在将CLIP(一种视觉-语言模型)适配于3D理解任务。该分词器解决了将CLIP(在2D图像块上训练)应用于不规则和稀疏的3D点云的挑战。UTok3D学习了一个尺度归一化的3D分词器,使冻结的CLIP视觉编码器能够解释3D数据,从而在ShapeNetPart、ScanNetV2S3DIS、SemanticKITTI和nuScenes等多样化数据集上实现无标注3D分割。 AI

影响 能够有效地重用大规模视觉-语言模型来执行3D任务,可能加速需要3D数据分析的领域的研究和开发。

排序理由 该集群包含一篇学术论文,详细介绍了一种将视觉-语言模型适配于3D理解的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的UTok3D分词器将CLIP适配于3D理解任务

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Guofeng Mei, Qinfeng Xiao, Bin Ren, Luigi Riz, Juan Liu, Xiaoshui Huang, Xu Zheng, Nicu Sebe, Ming-Hsuan Yang, Fabio Poiesi ·

    Parameter-Efficient CLIP Adaptation for 3D Understanding via Unified Tokenization

    arXiv:2505.18819v2 Announce Type: replace Abstract: Vision-language models, such as CLIP, encode rich semantic knowledge through large-scale image-text pretraining. Reusing these models for 3D understanding is highly desirable, because 3D-text pairs and dense point-level annotati…