PulseAugur
实时 10:12:31
English(EN) Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

新方法通过关注集体消息来压缩 VLM 视觉数据

研究人员开发了一种名为 Grounded Message Coreset Pruning (GMC) 的新方法,用于高效压缩视觉语言模型 (VLM) 的视觉信息。与以往将视觉 token 独立处理的方法不同,GMC 专注于保留语言解码器所需的集体消息。该方法旨在通过最小化处理的视觉 token 数量来降低推理成本,同时保持模型性能。实验表明,GMC 可以在能力损失最小的情况下显著减少 token 使用量,甚至在某些情况下能提高性能。 AI

影响 该方法可以显著降低运行视觉语言模型的计算成本,使其更易于访问和更高效。

排序理由 这是一篇研究论文,详细介绍了一种用于压缩视觉语言模型中视觉数据的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法通过关注集体消息来压缩 VLM 视觉数据

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang ·

    Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

    arXiv:2608.02134v1 Announce Type: new Abstract: Modern vision language models (VLMs) turn high-resolution images into long sequences of visual tokens. Every token traverses the language decoder and persists in its prompt KV cache, inflating inference cost and motivating aggressiv…