PulseAugur
实时 09:40:33
实体 Vision-Language Model (VLM)

Vision-Language Model (VLM)

PulseAugur coverage of Vision-Language Model (VLM) — every cluster mentioning Vision-Language Model (VLM) across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_109502 ·

    机器人操作模型通过两阶段训练获得运动先验 · 跟踪 2 个来源

    研究人员开发了一种新颖的两阶段训练框架,以改进用于机器人操作的视觉-语言-动作 (VLA) 模型。该方法首先使用无条件动作轨迹预训练具有运动先验的动作模块,然后将其与视觉和语言特征对齐。通过为动作模块提供明确的运动先验,该方法提高了收敛速度、成功率和性能,尤其是在数据有限的现实世界任务中。

  2. TOOL · CL_29381 ·

    RAW-Dream 通过任务无关的世界模型实现零样本VLA适应

    研究人员推出了一种新方法 RAW-Dream,该方法通过在任务无关的世界模型中使用强化学习来适应新的视觉-语言-动作(VLA)模型。该方法利用在多样化、无任务行为上预训练的世界模型和现成的视觉-语言模型来生成奖励,从而将世界模型学习与特定任务依赖性分离开来。通过依赖于泛化的物理先验而不是特定任务的数据,RAW-Dream 能够实现 VLA 的零样本适应,并通过双重噪声验证机制显著提高可扩展性并减少世界模型幻觉。