研究人员开发了 3DZip,一个新颖的三阶段框架,旨在压缩 3D 视觉语言模型 (3D VLM) 的令牌。该方法解决了 3D VLM 中每场景通常产生的数千个令牌所带来的显著计算和内存开销。通过采用粗粒度体素化、使用行列式点过程的特征空间多样性选择以及空间约束合并,3DZip 在保持几何一致性的同时有效地减少了令牌数量。实验表明,3DZip 仅用 128 个令牌即可保持 94.7% 的原始性能,在 3D 问答基准测试中推理速度提高了 1.92 倍。 AI
影响 降低了 3D 视觉语言模型的计算成本,实现了更快的推理速度,并在空间推理任务中得到更广泛的应用。
排序理由 该集群描述了在 arXiv 研究论文中发布的一种新方法。
在 Hugging Face Daily Papers 阅读 →
- 2D visual features
- 2D VLMs
- 3D Question Answering with Scene Graph Reasoning
- 3D vision-language models
- 3DZip
- arXiv
- Determinantal point process
- Hugging Face
- ECCV 2026
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →