PulseAugur
实时 05:18:12
English(EN) When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics

新方法剪枝VLM标记以提高效率和相关性

研究人员开发了一种名为“结构到语义”(STS)的新方法,以提高视觉语言模型(VLM)的效率。目前用于剪枝视觉标记(以减少计算负载)的方法通常仅依赖于注意力分数,这会导致重要上下文细节的丢失。STS通过一个两阶段过程来解决这个问题:首先,它最大化空间和结构多样性;其次,它根据与提示的语义相关性来过滤标记。这种方法旨在保留更多样化和相关的信息,以实现更好的任务对齐。 AI

影响 这种新的剪枝技术可能带来更高效、更强大的视觉语言模型,从而降低复杂AI任务的计算成本。

排序理由 该集群包含详细介绍AI模型优化新方法的学术论文。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →

新方法剪枝VLM标记以提高效率和相关性

报道来源 [4]

  1. arXiv cs.AI TIER_1 English(EN) · Jiahui Wang, Kai Zhang, Mai Han, Huanghe Zhang ·

    当注意力崩溃时:从结构到语义的阶段感知视觉令牌修剪

    arXiv:2606.03569v1 Announce Type: cross Abstract: Vision-Language Models (VLMs) have demonstrated remarkable capabilities but suffer from significant computational overhead during inference. While visual token pruning offers a promising solution, existing methods predominantly re…

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    当注意力崩溃时:从结构到语义的感知式视觉令牌修剪

    Vision-Language Models (VLMs) have demonstrated remarkable capabilities but suffer from significant computational overhead during inference. While visual token pruning offers a promising solution, existing methods predominantly rely on initial attention scores. This single-metric…

  3. arXiv cs.CV TIER_1 English(EN) · Huanghe Zhang ·

    当注意力崩溃时:从结构到语义的感知式视觉标记剪枝

    Vision-Language Models (VLMs) have demonstrated remarkable capabilities but suffer from significant computational overhead during inference. While visual token pruning offers a promising solution, existing methods predominantly rely on initial attention scores. This single-metric…

  4. arXiv cs.CV TIER_1 English(EN) · Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang ·

    MergeTok:通过令牌合并实现统一的连续和离散视觉令牌化

    arXiv:2605.30904v1 Announce Type: new Abstract: Most visual tokenizers for image generation are bifurcated into two families with complementary limitations: continuous VAEs offer high-fidelity reconstruction but suffer from dense, entangled latents that are poorly suited for sema…