研究人员正在开发新的方法来优化多模态大语言模型(MLLMs),通过剪枝计算成本高昂的视觉标记。一种方法MAP通过学习中间层注意力来预测视觉标记的重要性,在只保留一小部分标记的情况下实现了显著的性能保留。另一种方法RoRA侧重于面向角色的区域分配,将保留的标记视为具有特定功能以提高效率。第三个框架AutoPrune采用AI4AI方法,通过专门的领域特定语言让大语言模型设计自己的剪枝算法,在各种基准测试中都显示出有效性。 AI
影响 这些在视觉标记剪枝方面的进展可以显著降低多模态大语言模型的推理成本和延迟,从而实现更广泛的应用和更高效的系统。
排序理由 arXiv上发表了多篇研究论文,详细介绍了多模态大语言模型中视觉标记剪枝的新颖方法。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →