3D vision-language models
PulseAugur coverage of 3D vision-language models — every cluster mentioning 3D vision-language models across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的HiSC框架提升三维视觉语言模型效率
研究人员推出了一种新颖的HiSC框架,旨在提高三维视觉语言模型(3D VLMs)的效率。该方法解决了三维场景中令牌冗余导致的高计算成本问题。HiSC采用分层空间聚类方法,根据几何和语义线索对令牌进行分组以进行压缩,从而在显著降低计算负荷的同时保留了关键细节。
-
HiSC框架将三维VLM令牌冗余减少90%以上
研究人员推出了一种名为HiSC的新型框架,旨在提高三维视觉语言模型(3D VLM)的效率。这种无需训练的方法通过将令牌组织成基于空间的聚类来解决三维场景中显著的令牌冗余问题。HiSC在推理前采用基于空间图的合并策略来整合相似的冗余令牌,并在推理过程中采用分层压缩方法来保持对象的完整性和细粒度细节。实验表明,HiSC可以在各种三维推理基准测试中实现超过90%的令牌缩减,同时性能下降极小。
-
3DZip 框架将 3D VLM 令牌减少 97%,提升推理速度
研究人员开发了 3DZip,一个新颖的三阶段框架,旨在压缩 3D 视觉语言模型 (3D VLM) 的令牌。该方法解决了 3D VLM 中每场景通常产生的数千个令牌所带来的显著计算和内存开销。通过采用粗粒度体素化、使用行列式点过程的特征空间多样性选择以及空间约束合并,3DZip 在保持几何一致性的同时有效地减少了令牌数量。实验表明,3DZip 仅用 128 个令牌即可保持 94.7% 的原始性能,在 3D 问答基准测试中推理速度提高了 …
-
ReFine3D框架增强3D视觉语言模型适应性
研究人员开发了ReFine3D,一个用于微调3D视觉语言模型的新框架。该方法解决了在数据有限的情况下将这些模型适应新领域所面临的挑战,防止过拟合和灾难性遗忘。ReFine3D采用选择性层微调,并结合多视图一致性和文本多样性正则化技术。实验表明,ReFine3D在3D领域泛化基准测试中显著提高了泛化能力、迁移能力和少样本准确率。