PulseAugur
实时 09:22:18

揭示了用于高效视觉令牌压缩的 VLM 新方法

两篇新研究论文提出了用于压缩视觉语言模型 (VLM) 中视觉令牌以提高效率的方法。第一篇论文《并非所有视觉令牌都可以安全移除》(Not All Visual Tokens Are Equally Safe to Remove)引入了一种考虑后果的方法,优先为潜在错误成本较高的请求进行视觉计算。第二篇论文《VisionSelector》提出了一个端到端可学习的框架,该框架能够自适应地识别关键令牌,其性能优于启发式方法,并显著加快了推理速度。 AI

影响 这些方法可以显著降低多模态人工智能系统的计算成本和延迟,从而实现更广泛的部署和更快的处理。

排序理由 arXiv 上发表的两篇研究论文提出了用于压缩视觉语言模型中视觉令牌的新颖方法。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

揭示了用于高效视觉令牌压缩的 VLM 新方法

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang ·

    并非所有视觉标记都同样安全可移除:后果敏感型视觉标记压缩

    arXiv:2608.09176v1 Announce Type: cross Abstract: Visual token compression for vision--language models (VLMs) has largely relied on criteria such as attention, redundancy, and uncertainty to maximize average accuracy under a fixed compute budget, implicitly assuming that all erro…

  2. arXiv cs.CV TIER_1 English(EN) · Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha ·

    VisionSelector:面向高效多模态大语言模型的端到端可学习视觉标记压缩

    arXiv:2510.16598v2 Announce Type: replace Abstract: Multimodal Large Language Models (MLLMs) encounter significant computational and memory bottlenecks from the massive number of visual tokens generated by high-resolution images or multi-image inputs. Previous token compression t…