研究人员开发了多种新方法来高效剪枝多模态大语言模型(MLLM)的视觉令牌,旨在降低推理成本和延迟。LAST框架利用最后一个查询令牌的注意力来指导剪枝,无需访问云端模型,即可在将令牌数量减少87.5%的同时保留94.5%的准确率。SFPruner将剪枝重新构建为单次前向传播,将Qwen2.5-VL的令牌选择时间从112.4毫秒显著缩短至2.5毫秒。SPARE是另一种方法,将剪枝视为子空间重建,通过最小化重建误差并纳入“反相关性”标准,在LLaVA上可移除高达94%的令牌,同时保持95%的基线性能。 AI
影响 这些视觉令牌剪枝方面的进展可以显著降低MLLM的推理延迟和计算成本,从而在边缘设备上实现更高效的部署并提高可访问性。
排序理由 多篇研究论文介绍了优化多模态大语言模型的新技术。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Jaeyeon Lee
- LLaVA
- SPARE
- Hugging Face
- LAST
- multimodal large language model
- Qwen2.5-VL
- SFPruner
- vision-language model
- visual token pruning
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →