研究人员开发了UTok3D,一个新颖的参数高效框架,旨在将CLIP(一种视觉-语言模型)适配于3D理解任务。该分词器解决了将CLIP(在2D图像块上训练)应用于不规则和稀疏的3D点云的挑战。UTok3D学习了一个尺度归一化的3D分词器,使冻结的CLIP视觉编码器能够解释3D数据,从而在ShapeNetPart、ScanNetV2、S3DIS、SemanticKITTI和nuScenes等多样化数据集上实现无标注3D分割。 AI
影响 能够有效地重用大规模视觉-语言模型来执行3D任务,可能加速需要3D数据分析的领域的研究和开发。
排序理由 该集群包含一篇学术论文,详细介绍了一种将视觉-语言模型适配于3D理解的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →