Vision-Language Action Models
PulseAugur coverage of Vision-Language Action Models — every cluster mentioning Vision-Language Action Models across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的QWM框架通过世界模型增强强化学习
研究人员推出了一种新颖的QWM框架,该框架将世界模型与Q学习相结合,以提高强化学习的样本效率。该方法使用世界模型在想象的轨迹上进行测试时搜索,从而在不直接在预测状态上优化策略的情况下改进动作选择。QWM仅在真实转换上进行训练,从而避免了模型偏差的累积,并在RoboMimic和LIBERO等具有挑战性的操纵基准上展示了显著的性能提升。
-
新框架FabriMAE增强VLA模型自我评估能力
研究人员开发了FabriMAE,一个新颖的视觉-语言-动作(VLA)模型自我评估框架。该框架名为马尔可夫注意力熵(MAE),利用内部视觉模态熵来评估动作生成的可靠性,而无需外部监督。MAE将内部注意力信号转换为架构感知的可靠性分数,在大量实验中表现优于现有基线。该框架在LIBERO-Reflect基准上进行了测试,并展示了对PI系列模型鲁棒性的改进。
-
VLASH方法提升机器人VLA推理速度和准确性
研究人员开发了VLASH,一种用于提高机器人视觉-语言-动作(VLA)模型实时性能的新颖方法。传统的同步推理会导致显著的延迟,限制了VLA在动态环境中的应用。VLASH采用异步推理,使机器人能够同时执行动作和处理信息。它通过根据先前动作预测未来状态来实现这一点,在无需架构更改或增加开销的情况下弥合了预测与执行之间的差距。实验表明,VLASH将反应延迟降低了高达11.8倍,并提高了比现有异步方法的准确性,使得先进的VLA能够执行诸如乒乓…
-
具身数据金字塔组织人工智能训练数据源
一篇新论文介绍了具身数据金字塔(Embodied Data Pyramid),这是一个用于组织训练具身人工智能系统所使用的各种数据源的框架。该金字塔将数据分为五个层次:真实机器人数据、UMI风格数据、自身中心/外部中心数据、模拟数据以及通用视觉语言数据。该分类有助于分析当前的具身基础模型(包括具身大脑模型、视觉语言动作模型和世界动作模型)如何组合这些数据源来发展感知、推理和动作生成能力。作者们还强调了具身人工智能数据收集和利用方面的六…
-
新方法增强VLM到VLA的适应性以实现机器人控制 · 跟踪2个来源
两篇新的研究论文提出了将视觉语言模型(VLM)适配为机器人视觉语言动作(VLA)模型的方法。第一篇论文介绍了CLAP(因果语言-动作预测),它将自然语言描述添加到动作序列中,以在微调过程中保持VLM的能力。第二篇论文Anchor-Align使用表示锚定和语言-动作对齐来防止预训练表示被覆盖并提高泛化能力。两种方法在机器人基准测试和物理机器人测试中都显示出显著的改进。
-
板载VLM赋能机器人多智能体控制系统
研究人员开发了一种用于机器人控制的多智能体系统(MAS)架构,该架构利用板载视觉语言模型(VLM)来克服可解释性、泛化性和计算需求的限制。该系统在紧凑型硬件上部署专用智能体,无需外部云计算。在模拟的工业仓库中进行了测试,该MAS成功地通过微调的VLM管理了安全检查、维护和响应人类请求等任务。引入了一种新颖的编排智能体“Megamind”,以解决小型模型在长时域规划中的上下文保留问题,证明了经济高效的板载解决方案在现实世界机器人应用中的可行性。
-
Hugging Face论文详述用于机器人技术的VLA模型改进
Hugging Face的两篇新研究论文探讨了视觉-语言-动作(VLA)模型的进展。第一篇论文介绍了LingBot-VLA 2.0,通过扩展其训练数据以包含多样化的机器人配置和人类视频,提高了泛化能力,并增强了其动作空间以涵盖复杂操作的全身运动。第二篇论文提出了SVA,一个通过蒙特卡洛树搜索和Q值模型将动作生成与后果评估解耦,从而改进冻结VLA模型的框架,证明该方法可以以更低的延迟超越更大的模型。
-
FurnitureVLA模型解决了真实规模的双臂家具组装问题
研究人员推出FurnitureVLA,这是一种新颖的视觉-语言-动作模型,专为真实规模的复杂、长时双臂家具组装任务而设计。该模型通过联合预测动作和连续进度信号来解决多步机器人操作中的挑战,这有助于自动子任务转换并减少错误累积。该系统在模拟中表现出显著的改进,成功率从48%提高到80%,并在Kinova Gen3机器人平台上进行了验证,性能下降极小。
-
OpenFrontier 导航框架无需特定任务训练
研究人员推出 OpenFrontier,一个专为在复杂、开放世界环境中运行的机器人设计的创新导航框架。该系统通过利用视觉前沿作为语义锚点,绕过了广泛的特定任务训练或微调的需要。OpenFrontier 集成了多种视觉语言先验模型,能够在没有密集 3D 语义映射或专业策略训练的情况下实现高效导航。该框架已展示出强大的零样本性能,并已成功部署在真实的移动机器人上。
-
新型VLM代理实现文本引导的6D物体姿态重排
研究人员开发了一种新颖的方法,利用闭环视觉语言模型(VLM)代理实现文本引导的6D物体姿态重排。该方法通过使VLM能够推断出与文本一致的6D目标姿态,解决了VLM在3D理解方面的局限性。该系统会迭代地观察场景,评估指令的一致性,提出姿态更新,并渲染更新后的场景,有效地充当代理。关键技术包括多视角推理、以物体为中心的坐标系可视化和单轴旋转预测,这些技术在无需额外微调的情况下显著提高了性能,并增强了机器人操作能力。
-
WoVR 框架使用受控世界模型改进 VLA 模型强化学习
研究人员开发了 WoVR,一个新颖的框架,旨在通过使用世界模型作为模拟器来增强视觉-语言-动作 (VLA) 模型的强化学习。这种方法解决了通常阻碍策略优化的想象式 rollout 中出现的幻觉和错误累积的挑战。WoVR 通过动作条件视频世界模型提高了 rollout 的稳定性,通过关键帧初始化的 rollout 减少了有效错误深度,并通过世界模型-策略协同演进确保了策略-模拟器的一致性。实验表明,WoVR 促进了长时程想象式 roll…
-
新研究增强了用于机器人和视觉推理的VLA模型
近期研究探索了增强用于机器人操作和通用视觉推理的视觉-语言-动作(VLA)模型。研究通过域随机化和照片级真实感渲染来研究模拟到现实的泛化能力,并提出诸如 Faithful Warm-Start 等方法,通过在强化学习前确保视觉保真度来提高VLM推理的稳定性。其他工作引入了置信度驱动的测试时强化学习,无需外部奖励即可实现自我改进,以及状态感知分词器,以更好地从离散代码中解码动作。此外,研究还检查了VLA模型中的架构冗余,发现语言骨干对于…
-
新基准和方法改进了 AI 代理的不确定性量化
研究人员开发了新的方法来量化与图形用户界面 (GUI) 交互的 AI 代理以及机器人技术中使用的视觉-语言-动作模型 (VLA) 的不确定性。第一项研究“Argus”在各种代理和数据集上对 27 种方法进行了基准测试,发现不确定性排名在同一模型类别内是稳定的,但在不同模型和界面之间会下降。第二项研究为基于流匹配的 VLA 引入了速度场不一致性 (VFD),证明了其在故障检测方面的有效性,并实现了一个名为 SAVE 的框架,该框架能够以…
-
新的AI模型应对自动驾驶的远期规划问题
研究人员正在开发先进的自动驾驶AI模型,重点是改进轨迹规划和远期决策。包括ParkingTransformer、TerraTransfer、AlignDrive、Metis和GraphWorld在内的几个新框架,利用了LLM、自我博弈和基于图的世界建模等技术,以增强复杂驾驶场景下的泛化性、效率和安全性。这些方法旨在通过更好地整合感知、预测和规划,以及从多样化数据中学习而不完全依赖专家演示,来克服现有方法的局限性。
-
新的机器人策略模型增强了动作生成和效率
研究人员开发了新的机器人策略学习方法,提高了动作生成效率和准确性。LeaP(一种可学习的源先验)通过对本体感觉进行条件化来优化动作生成的起点,从而在操作任务上取得了显著的性能提升。LaWAM引入了潜在世界动作模型,该模型预测紧凑的潜在视觉子目标而非完整的视频帧,从而在保持高成功率的同时降低了计算延迟。几何动作模型(GAM)将几何基础模型重新用于语言条件操作,直接整合3D几何以实现更鲁棒、更高效的控制。
-
自回归策略在VLA模型中实现实时执行
一篇新的研究论文介绍了一种在视觉-语言-动作(VLA)模型的自回归策略中实现实时执行的方法。该方法通过调整标记化范围和采用约束解码来保证严格的延迟界限。这使得多轨迹解码成为可能,从而提高了任务完成速度,并在模拟和现实世界环境中均优于等效的流匹配策略。
-
机器人通过关键点跟踪从人类视频中学习操作
研究人员开发了一个名为 Dexterous Point Policy 的新框架,可以直接从人类视频中学习机器人操作技能,无需昂贵的机器人特定演示。该系统利用统一的物体和手部三维关键点表示来弥合人类和机器人动作之间的差距。该方法在现实世界任务中取得了 75.0% 的成功率,显著优于仅取得 1.0% 成功率的最先进基线。
-
新的“状态后门”攻击针对具身AI模型
研究人员开发了一种针对视觉-语言-动作(VLA)模型的新型后门攻击,VLA模型对于机器人等具身AI应用至关重要。与依赖可见视觉触发器的先前方法不同,这种新颖的“状态后门”利用机器人手臂的初始状态作为触发器。研究人员采用了一种偏好引导的遗传算法来寻找最小但有效的基于状态的触发器,在不影响正常任务性能的情况下实现了超过90%的攻击成功率。
-
CVPR 2026:计算机视觉与机器人学融合,中国AI占据主导地位
在丹佛举行的CVPR 2026会议标志着计算机视觉与机器人学的显著融合,重点关注多模态基础模型和具身AI。中国高校和企业展示了实质性进展,中国机构在论文录用方面占据主导地位,腾讯、阿里巴巴和MiniMax等行业参与者获得了顶级赞助商级别。关键研讨会讨论了在自动驾驶和机器人学中部署视觉-语言-动作模型,特斯拉和小鹏等公司积极参与。中国团队在实际挑战中也表现出色,小米在现实世界机器人竞赛中获得了多个冠军。
-
新的AI防御和攻击针对视觉-语言模型
研究人员开发了新的方法来防御和利用先进AI模型中的后门攻击。一种名为BYORn的方法旨在通过识别和替换微调过程中生成的语义上不合理的响应来提高大型视觉-语言模型的鲁棒性,从而保持干净的任务性能。与此同时,一种名为SILENTDRIFT的新攻击针对机器人领域使用的视觉-语言-动作模型,利用动作分块来创建视觉上与合法演示无法区分的隐蔽后门攻击。