研究人员推出了SceneActBench,一个旨在评估视觉语言模型(VLM)智能体在与3D环境交互和操作方面能力的新基准。与之前侧重于文本描述或单对象操作的基准不同,SceneActBench在一个统一的智能体-环境循环中,评估了智能体在五个不同3D任务中的表现。该基准使用PNG图像或视频帧,以及3D资产,来测试智能体在复杂、多对象3D场景中执行操作的能力。对十一种不同VLM配置的初步评估显示,性能范围在38.6-50.2之间,表明当前模型在所有任务上都难以持续表现出色。 AI
影响 该基准旨在提高VLM智能体在3D环境中交互和行动的能力,有望为涉及空间推理和操作的任务带来更强大的AI助手。
排序理由 该集群描述了一个用于评估AI模型的新基准,属于研究范畴。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →