一项新的研究论文挑战了视觉语言模型中的视觉键值(KV)缓存保留任务相关信息的假设。研究发现,保留在 KV 缓存中的视觉内容的数量在很大程度上与任务无关,并且与信息是否被因果用于回答问题无关。虽然注意力机制与因果利用显示出微弱的相关性,但像素可解码的可重构性被证明是 KV 缓存压缩的一个糟糕信号,一个模型保留的任务无关内容比另一个模型多 2.7 倍。 AI
影响 挑战了当前关于 KV 缓存效率的假设,并为优化视觉语言模型性能提供了新的方向。
排序理由 研究论文发布在 arXiv 上,详细介绍了视觉语言模型中视觉 KV 缓存的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- attention
- encoder-based model
- encoder-free model
- KV ablation
- KV cache
- Pixel Decodability Is Not a Compression Signal: Causally Evaluating Importance Proxies for Visual KV-Cache Eviction
- pixel-inversion decoder
- super-patch
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →