PulseAugur
实时 17:55:56

CRISP框架通过修剪视觉令牌来提高LVLM效率

研究人员开发了CRISP,一个新颖的框架,旨在通过在视觉令牌被语言模型处理之前对其进行修剪来提高大型视觉语言模型(LVLM)的效率。这种两阶段方法首先识别与文本对齐的令牌,然后增强上下文的完整性,旨在在显著降低推理成本和延迟的同时保持准确性。在LLaVA-1.5和LLaVA-NeXT模型上的实验表明,CRISP可以在保持高达99.5%的准确性的同时,将推理时间缩短一半以上,为资源受限的环境提供了一个实用的解决方案。 AI

影响 提高了LVLM推理的效率,使其在资源受限的环境中更易于访问。

排序理由 详细介绍一种提高LVLM效率的新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

CRISP框架通过修剪视觉令牌来提高LVLM效率

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo ·

    CRISP: 预训练大语言模型、但文本驱动的视觉标记剪枝,用于高效 LVLM 推理

    arXiv:2607.16326v1 Announce Type: new Abstract: Large Vision-Language Models (LVLMs) typically require processing hundreds to thousands of visual tokens, leading to substantial inference overhead. Existing visual token pruning methods either operate before the LLM using text-agno…