研究人员开发了MiCo,一种新颖的无需训练的方法,通过减少处理的视觉标记数量来优化多模态大语言模型(MLLM)的推理。MiCo采用两阶段剪枝方法,基于语义擦除建模和任务感知子集选择来选择代表性的视觉标记。该方法在各种MLLM和基准测试中始终优于现有技术,在保持高性能的同时显著提高了推理速度。例如,MiCo将LLaVA-NEXT-13B的视觉标记减少到5.6%,实现了3.8倍的加速,而性能仅下降2.5%。 AI
影响 该方法可以显著降低多模态人工智能系统的计算成本并提高其效率。
排序理由 该集群描述了arXiv论文中提出的一种用于优化多模态大语言模型推理的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Core Recommendations for Antifungal Stewardship: A Statement of the Mycoses Study Group Education and Research Consortium
- DagsHub
- Gotit.pub
- Hugging Face
- LLaVA-NEXT-13B
- MiCo
- multimodal large language model
- ScienceCast
- Tinghao Wang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →