研究人员开发了CoVeR,一种在处理由多视角图像表示的三维场景时,用于剪枝视觉语言模型(VLM)中视觉令牌的新颖方法。该技术解决了使用多视角产生的冗余令牌问题,这可能导致计算成本高昂。CoVeR是一种确定性的、无需训练的选择器,它使用令牌坐标来确保场景的完整空间覆盖,同时遵守确切的令牌预算,克服了先前基于重要性或体素化方法的局限性。实验表明,CoVeR在三维推理基准测试中显著优于现有的最先进方法,在大幅减少令牌数量的同时实现了高性能。 AI
影响 通过显著降低计算负载而不牺牲性能,从而实现视觉语言模型(VLM)中更高效的三维推理。
排序理由 该集群描述了一篇详细介绍改进视觉语言模型(VLM)新颖方法的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →