研究人员开发了一种名为 Gaze Attention 的新方法,以提高多模态大语言模型(MLLMs)的效率。与当前处理所有视觉 token 的模型不同,Gaze Attention 允许 MLLMs 选择性地关注与当前生成步骤相关的视觉区域。通过将视觉 token 分组到空间区域并选择与预测相关的区域,同时学习到的上下文 token 保留全局信息,这种方法减少了计算开销。实验表明,Gaze Attention 在视觉 KV 条目数量显著减少的情况下,可以匹配或超过密集注意力基线,并在相似预算下优于 KV 缓存逐出方法。 AI
影响 这种新方法通过降低计算成本,有望带来更高效、更强大的多模态人工智能系统。
排序理由 该集群包含一篇详细介绍多模态大模型新方法的论文。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gaze Attention
- Gotit.pub
- Hugging Face
- Junha Song
- Multimodal LLMs
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →