研究人员在多模态大语言模型(MLLMs)中发现了一种称为“视觉惯性”的现象,即模型倾向于固定在先前关注过的视觉区域,导致关系幻觉。提出了一种名为“惯性感知视觉激励”(IVE)的新解码方法,通过根据 token 级别的注意力历史动态重新校准视觉值来解决此问题。IVE 旨在区分新相关的 token 和持续存在的“惯性 token”,从而在保持各种 MLLMs 的整体多模态性能的同时,减少关系错误。 AI
影响 这项研究可以提高多模态AI在理解复杂视觉关系方面的准确性,影响需要精确对象交互分析的应用。
排序理由 学术论文,详细介绍了一种用于多模态LLM的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Boyang Gong
- Hugging Face
- Inertia-aware Visual Excitation (IVE)
- multimodal large language models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →