研究人员开发了 HeatKV,一种用于压缩视觉自回归模型所使用的 KV 缓存内存的新颖方法。该技术根据每个注意力头对先前生成的图像尺度的关注程度来调整其缓存分配。HeatKV 在 Infinity-2B 模型上实现了比现有方法高 2 倍的压缩率,同时保持了图像质量和提示对齐。 AI
影响 引入了一种显著降低视觉自回归模型内存需求的方法,有可能在硬件受限的情况下实现更大的模型或更快的生成。
排序理由 该集群包含一篇 arXiv 论文,详细介绍了一种新的模型压缩技术方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →