PulseAugur
实时 10:27:50
English(EN) MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models

新的MM-ShiftKV方法优化多模态LLM的KV缓存

研究人员开发了MM-ShiftKV,一种用于优化多模态大语言模型(MLLM)中键值(KV)缓存的新颖方法。该技术解决了预填充阶段KV选择方法(基于预填充统计数据估算KV重要性)在多模态推理期间表现不佳的问题,因为解码时查询的方差很大。MM-ShiftKV是一种无需训练的方法,它通过使用方差扩展查询代理来近似预填充期间的解码时查询行为。然后,它根据聚合的注意力质量来估算提示KV的重要性,在严格的KV缓存预算下,在多模态基准测试中始终优于现有方法。 AI

影响 该方法通过优化推理期间的内存使用,可以提高多模态LLM的效率和性能。

排序理由 该集群包含一篇详细介绍多模态大语言模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MM-ShiftKV方法优化多模态LLM的KV缓存

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Jinsong Shu, Chenyang Wu, Zhongle Xie, Baokun Wang, Lidan Shou ·

    MM-ShiftKV:面向多模态大语言模型的解码感知预填充阶段KV选择

    arXiv:2607.22586v1 Announce Type: new Abstract: Key-Value (KV) caching is essential for efficient inference in multimodal large language models (MLLMs), yet its memory footprint grows linearly with context length and becomes a major bottleneck due to the large number of visual to…