PulseAugur
实时 09:15:48
English(EN) 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

新的3DZip框架大幅削减3D视觉模型的令牌数量

研究人员开发了3DZip,一个新颖的令牌压缩框架,旨在降低3D视觉语言模型(3D VLMs)的计算和内存开销。与以往关注语义相关性或2D视觉特征的方法不同,3DZip专门解决了3D数据的空间特性。该框架采用三阶段过程:粗粒度体素化、使用行列式点过程(Determinantal Point Process)进行特征空间多样性选择,以及基于空间约束的合并。这种方法使3DZip能够以显著更少的令牌保持高性能,从而在3D问答基准测试中实现更快的推理速度。 AI

影响 降低了3D视觉语言模型的计算成本,实现了更高效的空间推理和问答。

排序理由 该集群描述了在arXiv论文中提出的一种用于优化3D视觉语言模型的新方法。

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的3DZip框架大幅削减3D视觉模型的令牌数量

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Changwoo Baek, Kyeongbo Kong ·

    3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

    arXiv:2608.01185v1 Announce Type: cross Abstract: Recent 3D vision-language models (3D VLMs) construct geometry aware tokens by projecting 2D visual features into world coordinates, enabling spatial reasoning for tasks such as 3D question answering. However, this design generates…