Vision Language Action (VLA) models
PulseAugur coverage of Vision Language Action (VLA) models — every cluster mentioning Vision Language Action (VLA) models across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的VLA模型通过多专家推理和多模态交互增强自动驾驶能力
两篇新的研究论文探讨了用于自动驾驶的先进视觉-语言-动作(VLA)模型。第一篇论文CoWorld-VLA介绍了一个多专家世界推理框架,该框架使用专门的token来条件化动作规划,并在NAVSIM数据集上展示了改进的性能。第二篇论文提出了一个通过关注多模态交互和多轨迹规划来增强VLA模型的系统,旨在实现更可靠和可解释的驾驶决策,尤其是在挑战性场景下。
-
新BATON方法通过子任务探索增强机器人操作
研究人员开发了一种名为BATON的新方法,通过将复杂任务分解为更小、可管理的子任务来改进长时机器人操作。该方法解决了多阶段任务中错误累积以及子任务成功不能保证下一阶段能利用其结果的问题。BATON独立探索每个子任务,并将解决方案存储在感知转换的内存中,这降低了探索成本并将失败归因于特定阶段。该方法在RoboMemArena基准测试中显示出更高的任务成功率。
-
Robo-Dopamine 2.0 通过历史感知奖励增强机器人操作
研究人员开发了 Robo-Dopamine 2.0,这是一种先进的过程奖励模型,旨在通过解决当前视觉-语言-动作 (VLA) 模型的局限性来改进机器人操作。该新模型结合了历史条件化和分布外 (OOD) 感知奖励,利用参考面板和观察到的滚动历史来更好地区分有效进展和任务无效失败。一种新颖的、具有转换感知重放的 Signed-Hop Curriculum 有助于学习,从而在视觉顺序一致性和下游强化学习任务(包括成功的现实世界插入)方面取得显著改进。
-
新的DURA攻击使用扩散模型操纵机器人
研究人员开发了一种名为DURA的新方法,该方法使用扩散模型为视觉-语言-动作(VLA)模型创建视觉上自然的对抗性补丁。这些补丁可以操纵机器人执行非预期操作,对实际应用构成重大安全风险。DURA在白盒和黑盒场景中都有效,在模拟和物理测试中均优于现有攻击方法,凸显了VLA系统改进防御的必要性。
-
DFM-VLA 引入了用于机器人操作的迭代动作精炼
研究人员推出 DFM-VLA,一种利用离散流匹配迭代精炼动作令牌的新型机器人操作方法。与先前一次生成固定令牌的方法不同,DFM-VLA 对概率速度场进行建模,以动态更新整个动作序列。该系统集成了度量对齐动作分词器 (MAAT) 和两阶段解码策略,以提高预测精度。在各种数据集和实际任务上的实验证明了这种迭代精炼技术的有效性。
-
Deltoris框架为具身AI实现实时VLA推理
研究人员开发了Deltoris,一个旨在为具身AI系统中的视觉-语言-动作(VLA)模型实现实时推理的新框架。该框架解决了基于扩散的VLA模型的高计算需求,这些模型对于先进的机器人和AI代理至关重要。Deltoris采用时间感知比特稀疏性来减少冗余计算,并通过推测性推理来分摊数据加载成本,从而显著提高了效率。
-
新研究整合世界模型以实现高效的具身AI控制
三篇新研究论文介绍了通过更有效地整合世界模型来增强具身AI控制的新方法。WorldSimProbe 专注于诊断动作条件世界模型的忠实度,确保其预测与物理现实一致。Enfold 提出一种将世界模型的生成计算内化到表示中的方法,显著降低了动作延迟。World Tokens 在训练过程中使用世界模型来改进动作预测,从而增强具身策略,并在推理时移除世界模型分支以保持高效部署。
-
新的DLAM模型增强了从视频数据中学习机器人动作的能力
研究人员推出了一种新的分布潜在动作模型DLAM,旨在改进从视频数据中学习机器人动作。与使用确定性转换的先前方法不同,DLAM将每个转换表示为对角高斯分布,从而实现更一致和结构化的潜在动力学。该方法将模型的均值与观察到的视觉变化联系起来,并通过归一化组合和反转技术约束均值和方差。通过冻结编码器并训练流匹配策略,DLAM在视频重建能力以及MetaWorld MT50和LIBERO等下游机器人任务中的策略性能方面均有所提升。
-
机器人研究在跨具身技能迁移方面取得进展 · 跟踪4个来源
研究人员开发了新的方法来改进机器人领域的跨具身迁移,使模型能够将在不同机器人形态上学习到的操作技能进行泛化。一种方法,“通过行为对齐表示进行跨具身迁移”,利用了视觉语言动作(VLA)模型中的末端执行器轨迹等表示,在模拟到现实的迁移中显示出28%的改进。另一种方法,“ContactFlow”,引入了一种基于3D接触点轨迹的具身无关动作表示,该表示允许在多样化的人类和机器人交互数据上训练世界模型,并展示了在不同机器人具身之间的成功迁移。
-
新数据集整合5个来源,用于增强自动驾驶交互分析
研究人员推出了交互式增强驾驶数据集(IEDD),这是一个旨在改进自动驾驶系统的大规模数据集。IEDD整合了来自五个现有自然轨迹数据集的数据,包括Lyft Level 5和Waymo,以捕捉数百万个密集的交互片段。该数据集具有详细的注释,如交互指标、重建的鸟瞰视频以及多轮问答对,支持面向Vision-Language-Action模型的先进分析和训练。
-
JoyNexus框架通过多租户提高VLA模型训练效率
研究人员推出JoyNexus,一个新颖的面向服务的框架,专为视觉-语言-动作(VLA)模型的多租户后训练设计。该系统通过解耦训练、推理和环境服务,解决了当前计算服务的低效率问题,允许多个租户共享GPU和CPU等资源,同时保持数据隔离。JoyNexus还实现了用于异构VLA数据模式的分组批处理,以提高训练效率和整体服务利用率。
-
新流水线通过专业化角色和数据策展提高机器人训练效率
研究人员开发了一种新颖的流水线,以提高大规模视觉语言动作(VLA)机器人模型训练后的人类效率。该方法通过将角色专业化为用于高价值干预的远程操作员和用于监控多个机器人的地面操作员,从而优化了人力,使得一小队人可以管理更多的机器人。该流水线还引入了VLAC-CUT,这是一个通过将机器人轨迹数据分割成有用、空闲、导致失败和恢复部分来策展数据的工具,这些数据随后与人工干预数据一起用于后续的训练轮次。该方法在现实世界的操作任务中显示出显著的改进…
-
ThinkProprio 整合机器人状态以提升 VLA 模型注意力和速度
研究人员开发了一种名为 ThinkProprio 的新方法,用于视觉-语言-动作 (VLA) 模型,该方法将本体感觉数据更有效地整合到决策过程中。与将状态信息视为后期条件信号的传统方法不同,ThinkProprio 将本体感觉离散化为 token,从而主动引导 VLA 模型对相关视觉信息的注意力。该方法在 CALVIN、LIBERO 和真实世界操作任务等各种基准测试中都表现出更高的性能和更低的推理延迟。
-
新的批评者衡量具身人工智能推理的忠实性
研究人员开发了一种新方法来评估视觉-语言-动作(VLA)模型在推理中的忠实性,特别是在自动驾驶等具身任务中。他们区分了提高性能的功能性推理和准确反映模型决策过程的忠实性推理。他们提出的批评者 Pinocchio 衡量中间推理步骤的接地和连贯性,当用作强化学习中的奖励信号时,与现有的对齐策略相比,忠实性提高了 4%,与轨迹误差基线相比,忠实性提高了 18%。
-
新的数据策略提升了VLA模型在机器人领域的空间泛化能力
研究人员开发了一种新的数据收集策略,以提高用于机器人操作的视觉-语言-动作(VLA)模型的空间泛化能力。研究认为,仅仅增加视点数量是不够的,模型常常会因为关注虚假关联而陷入捷径学习。通过采用一种结合连续摄像机运动和多样化静态视点的混合方法,所提出的方法显著减少了这些虚假关联,从而提高了性能和训练稳定性。该策略已被证明有利于各种VLA模型架构,使其能够更好地泛化到未见的摄像机姿态和物体配置。
-
新的TAP框架减少了VLA模型对专家数据的需求
研究人员引入了一个名为任务无关预训练(TAP)的新框架,旨在克服视觉-语言-动作(VLA)模型中的数据稀缺瓶颈。TAP采用两阶段方法:首先,它利用无标签交互数据通过自监督逆动力学目标学习可迁移的运动技能,然后用最少的专家语言数据来巩固这些技能。这种方法显著减少了对昂贵专家演示的需求,在标记数据量少几个数量级的情况下,达到了与在数百万专家轨迹上训练的模型相当的性能。
-
新的DART方法使单样本VLA模型能够适应环境迁移
研究人员开发了一种名为域算术(Domain ARiThmetic, DART)的新方法,能够以最少的数据高效地将视觉-语言-动作(VLA)模型适应到新环境。DART利用权重向量算术和特定域信息添加,仅需一次演示即可完成适应。该方法在模拟和真实世界场景中均优于现有方法,解决了相机姿态或机器人实体变化带来的挑战。
-
X-Mind 框架整合预测世界模型以实现高效的端到端驾驶
研究人员推出 X-Mind,一个旨在通过整合预测世界模型来增强 Vision-Language-Action (VLA) 模型端到端驾驶能力的新框架。与先前将这些模型视为外部或浅层添加物的方法不同,X-Mind 将其内化为视觉思维链 (Visual CoT),迫使模型在采取行动前推理未来的环境动态。为了解决效率问题,X-Mind 采用紧凑的视觉思维表示,将 12 帧的未来预测压缩到仅 96 个 token,并利用循环块扩散方案在单次前…
-
机器人操作模型通过两阶段训练获得运动先验 · 跟踪 2 个来源
研究人员开发了一种新颖的两阶段训练框架,以改进用于机器人操作的视觉-语言-动作 (VLA) 模型。该方法首先使用无条件动作轨迹预训练具有运动先验的动作模块,然后将其与视觉和语言特征对齐。通过为动作模块提供明确的运动先验,该方法提高了收敛速度、成功率和性能,尤其是在数据有限的现实世界任务中。
-
新的FORCE框架提升了视觉-语言-动作模型强化学习微调的效率
研究人员开发了FORCE,一个新颖的三阶段框架,旨在提高视觉-语言-动作(VLA)模型强化学习(RL)微调的效率和稳定性。该方法通过价值校准预热阶段稳定Q函数,解决了灾难性遗忘和低效策略更新等常见问题。FORCE还过滤动作,确保仅使用高价值数据进行策略更新,从而在无人干预的情况下实现显著的性能提升和加速训练。