两篇新研究论文指出了当前视觉语言模型(VLMs)的局限性,特别是在微调后保留知识的能力以及在视觉推理中缺乏“主体性”方面。第一篇论文《视觉-语言-动作模型是否了解基础知识?》引入了Act2Answer协议,通过让具身VLA模型通过动作选择答案来评估它们,结果显示它们在简单概念上表现良好,但在比其源VLMs更丰富的语义类别上却表现不佳。第二篇论文《主体性:视觉推理中系统性的主体性缺失》认为,VLMs受限于缺乏主体性,导致它们充当被动的语义检索器,而不是主动的视觉信息探索者,而他们提出的视觉隐式推理诊断基准(V-IRD)则弥补了这一差距。 AI
影响 强调了当前视觉语言模型存在的关键差距,表明需要新的评估方法和架构来促进主动推理和更好的知识保留。
排序理由 arXiv上发表的两篇学术论文,讨论了视觉语言模型的局限性。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Vision-language model
- Visual Implicit Reasoning Diagnosing Benchmark
- Act2Answer
- Hugging Face
- Vision-language-action model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →