研究人员推出PROBE,一个旨在评估和微调视觉语言模型(VLM)在动态、真实环境中需要操纵的任务的新框架。该框架通过使代理在回答问题前能够移动或推动物品,解决了当前VLM在处理被遮挡物体方面的局限性。PROBE包括一个高保真模拟器PROBE-Sim和一个基准套件PROBE-Bench,包含150个任务。结果表明,使用操纵工具的VLM代理的性能优于仅感知基线,并且一种微调方法PROBE-Agent进一步提高了性能并展示了从模拟到现实的迁移能力。 AI
影响 这项研究可能促成更强大的机器人代理,使其能够与复杂、真实的环境进行交互和理解。
排序理由 该集群描述了一篇介绍VLM代理框架和基准的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →