VLM agents
PulseAugur coverage of VLM agents — every cluster mentioning VLM agents across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的PROBE框架增强了用于操纵任务的VLM代理
研究人员推出PROBE,一个旨在评估和微调视觉语言模型(VLM)在动态、真实环境中需要操纵的任务的新框架。该框架通过使代理在回答问题前能够移动或推动物品,解决了当前VLM在处理被遮挡物体方面的局限性。PROBE包括一个高保真模拟器PROBE-Sim和一个基准套件PROBE-Bench,包含150个任务。结果表明,使用操纵工具的VLM代理的性能优于仅感知基线,并且一种微调方法PROBE-Agent进一步提高了性能并展示了从模拟到现实的迁移能力。
-
新的 SELA 框架使用 VLM 代理进行可解释的时间序列事件检测
研究人员开发了一个名为 SELA 的新框架,使用神经符号 VLM 代理在多变量时间序列数据中检测事件。这种称为语言引导 TSED 的方法利用事件的文本描述,以最少或无标记数据的方式识别信号中的相应区间。该系统利用事件逻辑树 (ELT) 知识表示,将语言描述转换为结构化时间逻辑,从而能够对信号原语进行接地,并为检测到的事件生成忠实、树状的解释。在真实世界能源和气候数据集上的实验表明,SELA 在现有的监督和零/少样本时间序列推理基线方面有所改进。
-
新的 GROW 框架通过适配的 GRPO 增强 VLM 代理
研究人员推出了一种新颖的强化学习框架 GROW,旨在增强视觉语言模型 (VLM) 代理在开放世界任务中的能力。与以往严重依赖监督微调的方法不同,GROW 通过将轨迹分解为状态-动作样本来适配 Group Relative Policy Optimization (GRPO) 算法。这种方法缓解了标准 GRPO 中固有的长上下文和噪声问题,实现了更有效的多轮学习。在超过 800 个 Minecraft 任务上的实验表明,GROW 达到了…
-
AtlasVA框架通过视觉技能记忆增强视觉语言模型智能体
研究人员推出AtlasVA,一个旨在增强视觉语言模型(VLM)智能体视觉技能记忆的新框架。与将视觉信息转换为文本的现有方法不同,AtlasVA维护了一个视觉基础的记忆结构。该结构包括空间热图、视觉范例和符号文本技能,能够实现更有效的空间决策和密集视觉反馈。