研究人员开发了一种名为使用最优输运聚合视觉信息 (AVIOT) 的新方法,用于压缩语言模型的视频令牌序列。该技术将压缩视为一个输运问题,将来自帧的密集视觉信息映射到更紧凑的表示。AVIOT 通过调整输运成本来适应特定任务的内容,并结合空间粒度来融合来自不同区域的表示,即使在高压缩率下也能提高视频理解基准的性能。 AI
影响 该方法通过在不牺牲性能的情况下实现更高的压缩率,有可能显著降低视频语言模型的计算成本。
排序理由 详细介绍视频令牌压缩新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →