研究人员推出了一种新颖的免训练框架PACE,旨在加速视觉语言模型(VLM)的推理速度。PACE通过统一的压缩和提取范式优化视觉编码器和LLM,解决了现有方法的局限性。该框架包含一个自适应像素压缩器,用于在编码前对冗余视觉输入进行下采样,以及一个动态双注意力提取器,用于选择性地保留任务关键的视觉标记。与Qwen2.5-VL-7B集成后,PACE在仅使用10%视觉标记的情况下,实现了3.1倍的首个标记生成时间加速,同时保持了原始性能的93.8%。 AI
影响 加速VLM推理速度并降低计算成本,可能促进更广泛的应用和实时应用。
排序理由 该项目是一篇研究论文,详细介绍了一种加速视觉语言模型推理的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Adaptive Pixel Compressor
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Dynamic Dual-Attention Extractor
- Gotit.pub
- Hugging Face
- PACE
- Qwen2.5-VL-7B
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →