一项新近发表在arXiv上的研究,探究了视觉语言模型(VLMs)的抽象推理能力。研究人员发现,尽管VLMs在视觉任务上表现出色,但在抽象推理方面却存在困难。他们利用一种称为关系匹配样本(RMTS)的心理学范式,追溯了这一缺陷。通过分析GPT、Claude和Gemini等前沿模型,以及Qwen 3.5和Gemma 4等开源模型,该研究确定了影响关系推理的关键因素,包括模型规模和对象复杂度。进一步的机制分析揭示了VLMs内部存在两个相互竞争的电路:一个专注于对象特征,另一个专注于抽象关系,后者对于抽象推理任务至关重要。 AI
影响 识别出VLM抽象推理的具体局限性,并提出了一种机制性理解,可能指导未来的模型开发。
排序理由 发表在arXiv上的学术论文,详细介绍了关于VLMs的研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →