PulseAugur
实时 09:58:39
English(EN) VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip框架将多模态AI的上下文长度提升至200万token

研究人员推出VLZip,一个新颖的框架,旨在提高视觉语言模型(VLM)在处理长而交错的图像和文本序列时的效率。与之前的方法(要么修剪token,要么使用不太精确的架构)不同,VLZip采用分层蒸馏过程,将视觉和文本片段压缩成紧凑的“软前缀”。然后将这些前缀集成到每个解码器层中,显著降低了自注意力的计算负担,同时保留了全局上下文。为了更好地评估这些模型,该团队还开发了LongVLBench,一个专注于从视频内容进行叙事级推理的新基准。实验表明,VLZip能够支持高达12万token的训练和超过28万token的推理,并有潜力扩展到200万token,为长上下文多模态AI树立了新标准。 AI

影响 VLZip显著扩展了多模态模型的上下文窗口,使其能够对扩展的视觉和文本数据进行更复杂的推理。

排序理由 该集群描述了一篇关于多模态AI的新颖框架和基准的详细研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

VLZip框架将多模态AI的上下文长度提升至200万token

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang ·

    VLZip:统一的视觉和文本压缩,用于交错长上下文建模

    arXiv:2608.08630v1 Announce Type: new Abstract: Vision Language Models (VLMs) face significant challenges with ultra-long, interleaved image-text sequences due to the quadratic complexity of self-attention. Current solutions either resort to aggressive token pruning, risking irre…