研究人员开发了VIP-Router,一个新颖的系统,旨在通过为每个输入自适应地选择最佳视觉Token剪枝策略来优化多模态大语言模型(MLLM)的效率。与之前在所有输入上应用单一策略的方法不同,VIP-Router分析低成本的视觉和文本特征,以预测哪种剪枝方法将产生最高的准确性和效用。这个即插即用(plug-and-play)的解决方案与现有的MLLM和剪枝算法无缝集成,引入了最少的训练参数。在VTC-Bench Group A基准上的评估表明,VIP-Router显著优于固定策略基线,在平均准确率上实现了26.9%的相对提升,在平均效用上实现了22.0%的相对增长。 AI
影响 通过自适应地选择最佳视觉Token剪枝策略来提高MLLM的效率,有可能降低推理成本并改善各种模型的性能。
排序理由 详细介绍优化MLLM新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →