研究人员开发了GSTEP,一个旨在提高视频大型语言模型(VideoLLMs)效率的新型修剪框架。与先前在片段内局部修剪token的方法不同,GSTEP将视频建模为连续的时空信息流。它通过结合时空信息来计算token级别的密度,从而实现全局token采样,平衡信息密度和覆盖范围。实验表明,GSTEP可以在保持高性能的同时修剪大部分视觉token,从而在不同模型和设置下改善准确性-效率的权衡。 AI
影响 该方法可以显著降低运行VideoLLMs的计算成本,使其在需要实时视频理解的应用中更易于访问。
排序理由 详细介绍一种提高VideoLLM效率的新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →