PulseAugur
实时 09:25:13
English(EN) Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

新的AI框架解决多模态大语言模型中的视觉标记剪枝问题

研究人员正在开发新的方法来优化多模态大语言模型(MLLMs),通过剪枝计算成本高昂的视觉标记。一种方法MAP通过学习中间层注意力来预测视觉标记的重要性,在只保留一小部分标记的情况下实现了显著的性能保留。另一种方法RoRA侧重于面向角色的区域分配,将保留的标记视为具有特定功能以提高效率。第三个框架AutoPrune采用AI4AI方法,通过专门的领域特定语言让大语言模型设计自己的剪枝算法,在各种基准测试中都显示出有效性。 AI

影响 这些在视觉标记剪枝方面的进展可以显著降低多模态大语言模型的推理成本和延迟,从而实现更广泛的应用和更高效的系统。

排序理由 arXiv上发表了多篇研究论文,详细介绍了多模态大语言模型中视觉标记剪枝的新颖方法。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

新的AI框架解决多模态大语言模型中的视觉标记剪枝问题

报道来源 [3]

  1. arXiv cs.AI TIER_1 English(EN) · Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu ·

    为视觉Token修剪学习预测MLLMs中的中间层注意力

    arXiv:2608.06411v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) achieve strong performance across diverse vision-language tasks, but their efficiency is limited by the cost of processing numerous visual tokens. Visual token pruning can reduce this cost, b…

  2. arXiv cs.AI TIER_1 English(EN) · Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo ·

    RoRA:面向多模态大语言模型视觉令牌剪枝的角色导向区域分配

    arXiv:2608.07088v1 Announce Type: cross Abstract: Multimodal large language models (MLLMs) encode images as long visual token sequences, making prefilling and KV-cache storage expensive. Existing training-free pruning methods select tokens by importance, diversity, or spatial cov…

  3. arXiv cs.LG TIER_1 English(EN) · Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu ·

    面向视觉令牌剪枝的AI4AI框架

    arXiv:2608.07193v1 Announce Type: new Abstract: Visual-token pruning can substantially reduce the inference cost of multimodal large language models (MLLMs), yet existing methods largely rely on fixed, handcrafted heuristics and costly expert trial and error. As pruning objective…