两篇新研究论文提出了用于压缩视觉语言模型 (VLM) 中视觉令牌以提高效率的方法。第一篇论文《并非所有视觉令牌都可以安全移除》(Not All Visual Tokens Are Equally Safe to Remove)引入了一种考虑后果的方法,优先为潜在错误成本较高的请求进行视觉计算。第二篇论文《VisionSelector》提出了一个端到端可学习的框架,该框架能够自适应地识别关键令牌,其性能优于启发式方法,并显著加快了推理速度。 AI
影响 这些方法可以显著降低多模态人工智能系统的计算成本和延迟,从而实现更广泛的部署和更快的处理。
排序理由 arXiv 上发表的两篇研究论文提出了用于压缩视觉语言模型中视觉令牌的新颖方法。
- alphaXiv
- arXiv
- CatalyzeX
- computer science
- Computer vision and pattern recognition
- DagsHub
- Gotit.pub
- Hugging Face
- Jiaying Zhu
- Multimodal Large Language Models
- Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression
- ScienceCast
- Vision--Language Models
- VisionSelector
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →