研究人员推出了VGEBench,这是一个旨在评估视觉语言模型(VLM)可泛化的视觉基础探索能力的新基准。目前的具身探索方法通常依赖于模仿学习,这限制了智能体的泛化能力。VGEBench旨在通过使用一个逻辑驱动的状态机框架来模拟多轮交互循环,迫使智能体通过主动的视觉感知和反馈驱动的纠正来实现目标,而不依赖于显式文档或标注轨迹。初步实验表明,现有的VLM在将语义知识转化为物理执行和维持长时程状态跟踪方面存在困难。 AI
影响 该基准可以通过提供一种标准化的方法来测试和改进VLM在交互环境中的泛化能力,从而推动具身AI的进步。
排序理由 该项目是一篇学术论文,介绍了一个用于评估AI能力的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Logic-Driven State Machine
- ScienceCast
- VGEBench
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →