研究人员推出VLZip,一个新颖的框架,旨在提高视觉语言模型(VLM)在处理长而交错的图像和文本序列时的效率。与之前的方法(要么修剪token,要么使用不太精确的架构)不同,VLZip采用分层蒸馏过程,将视觉和文本片段压缩成紧凑的“软前缀”。然后将这些前缀集成到每个解码器层中,显著降低了自注意力的计算负担,同时保留了全局上下文。为了更好地评估这些模型,该团队还开发了LongVLBench,一个专注于从视频内容进行叙事级推理的新基准。实验表明,VLZip能够支持高达12万token的训练和超过28万token的推理,并有潜力扩展到200万token,为长上下文多模态AI树立了新标准。 AI
影响 VLZip显著扩展了多模态模型的上下文窗口,使其能够对扩展的视觉和文本数据进行更复杂的推理。
排序理由 该集群描述了一篇关于多模态AI的新颖框架和基准的详细研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →