研究人员开发了CRISP,一个新颖的框架,旨在通过在视觉令牌被语言模型处理之前对其进行修剪来提高大型视觉语言模型(LVLM)的效率。这种两阶段方法首先识别与文本对齐的令牌,然后增强上下文的完整性,旨在在显著降低推理成本和延迟的同时保持准确性。在LLaVA-1.5和LLaVA-NeXT模型上的实验表明,CRISP可以在保持高达99.5%的准确性的同时,将推理时间缩短一半以上,为资源受限的环境提供了一个实用的解决方案。 AI
影响 提高了LVLM推理的效率,使其在资源受限的环境中更易于访问。
排序理由 详细介绍一种提高LVLM效率的新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →