PulseAugur
实时 23:24:04
English(EN) Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

新论文揭示视觉语言模型缺乏主体性和知识保留能力

两篇新研究论文指出了当前视觉语言模型(VLMs)的局限性,特别是在微调后保留知识的能力以及在视觉推理中缺乏“主体性”方面。第一篇论文《视觉-语言-动作模型是否了解基础知识?》引入了Act2Answer协议,通过让具身VLA模型通过动作选择答案来评估它们,结果显示它们在简单概念上表现良好,但在比其源VLMs更丰富的语义类别上却表现不佳。第二篇论文《主体性:视觉推理中系统性的主体性缺失》认为,VLMs受限于缺乏主体性,导致它们充当被动的语义检索器,而不是主动的视觉信息探索者,而他们提出的视觉隐式推理诊断基准(V-IRD)则弥补了这一差距。 AI

影响 强调了当前视觉语言模型存在的关键差距,表明需要新的评估方法和架构来促进主动推理和更好的知识保留。

排序理由 arXiv上发表的两篇学术论文,讨论了视觉语言模型的局限性。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新论文揭示视觉语言模型缺乏主体性和知识保留能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yizhao Huang, Haoyang Chen, Shiqin Wang, Pohsun Huang, Jiayuan Li, Haoyuan Du, Yandong Shi, Zheng Wang, Zhixiang Wang ·

    职位:视觉推理中系统性的能动性缺失

    arXiv:2606.14795v1 Announce Type: new Abstract: This paper argues that a systemic lack of Agency constrains the implicit reasoning capabilities of current Vision-Language Models (VLMs). Implicit reasoning refers to the ability to autonomously discover and utilize hidden visual ev…