Libero
PulseAugur coverage of Libero — every cluster mentioning Libero across labs, papers, and developer communities, ranked by signal.
- developed World-Action Models 90%
- developed by Fast-WAM 90%
- developed Fast-WAM 90%
- instance of World-Action Models 90%
- used by RoboTwin 2.0 70%
- used by LIBERO-Plus 70%
- developed LIBERO-Plus 70%
- instance of LIBERO-Plus 70%
- used by World-Action Models 70%
- used by Vision Language Action (VLA) models 70%
- developed by Openvla 70%
- instance of Vision Language Action (VLA) models 70%
14 天有情绪数据
-
新的基准测试IndustrialVLA-Bench评估开放机器人策略模型
一个名为IndustrialVLA-Bench的新评估基准已被开发出来,用于评估开放机器人策略模型,特别是将视觉-语言-动作(VLA)模型与世界-动作模型(WAMs)进行比较。该基准引入了一个统一的报告模式,用于评估六个不同系统在能力、对非语言变化的鲁棒性以及指令敏感性方面的表现。结果表明,虽然模型在干净能力得分上相似,但在鲁棒性和释义评估中显示出显著差异,这表明评估协议的选择极大地影响了感知到的性能。
-
ActionCodec 通过优化的动作分词技术推进 VLA 模型
研究人员推出 ActionCodec,一种用于视觉-语言-动作 (VLA) 模型的新型动作分词方法。该方法侧重于优化 VLA 性能,而不仅仅是重建保真度,并确立了最大化时间分词重叠和最小化词汇冗余等设计原则。当应用于 SmolVLM2-2.2B 模型时,ActionCodec 在 LIBERO 基准测试上取得了 95.5% 的成功率,且无需先前的机器人训练,为 VLA 模型树立了新的最先进水平。
-
RoboRSI系统使机器人能够学习和重用技能
研究人员开发了RoboRSI,一个新颖的机器人自我改进系统,使机器人在复杂的真实环境中学习和重用技能。该系统利用自上而下的技能精炼(TSR)将任务分解为可管理的技能,从而实现稳定高效的技能进化。RoboRSI已在家庭清洁任务中取得成功,并在各种模拟基准测试中取得了高分,性能优于现有方法。
-
TERRA 引入新颖的机器人潜在动作学习方法
研究人员引入了 TERRA(时序效应表示和关系对齐),一种用于机器人潜在动作学习的新颖方法。TERRA 解决了两个关键挑战:潜在代码应从视觉转换中保留哪些信息,以及确保其在不同初始状态下含义的一致性。该系统通过用紧凑的时序效应描述转换来实现这一点,该效应包含净特征变化和窗口内动力学,然后指导连续潜在代码的学习。该效应空间也作为重用的参考,使效应锚定迁移(EAT)能够将解码后的潜在变量锚定到其源效应,从而通过跨上下文的动作而不是仅仅是原…
-
新型对抗性攻击TAPDreamer削弱了机器人世界动作模型
研究人员开发了TAPDreamer,一种针对机器人领域世界动作模型的新型对抗性攻击。该攻击生成固定的局部扰动,可应用于摄像头输入,显著降低这些模型的性能。与以往的攻击不同,TAPDreamer不需要访问目标模型的输出来创建可迁移的对抗性补丁,而是利用公共编码器来创建这些补丁。这些补丁覆盖输入的大约6.5%,在LIBERO和RoboTwin等基准测试中大幅降低了成功率,证明了机器人控制系统中共享视觉编码器的脆弱性。
-
紧凑型机器人策略通过细粒度的视觉表示实现高性能
研究人员开发了CoRP,这是一种紧凑型机器人策略,其参数数量远少于现有系统,但性能却很高。研究强调,多任务操作策略的有效性在很大程度上取决于视觉表示,而不是参数规模或生成先验。CoRP证明,预训练、任务适应和压缩的表示对于紧凑型策略至关重要,在LIBERO和RoboTwin 2.0等基准测试中表现优于规模大得多的模型。
-
新的视觉语言-动作框架使用“想象力”进行高效机器人控制
研究人员开发了IG-VLA,一个新颖的视觉语言-动作(VLA)模型框架,通过使模型能够“想象”未来场景演变来增强机器人操作。这种方法在最近的arXiv论文中有所介绍,它使用潜在时空推理来预测未来状态,而无需昂贵的像素级生成。为了进一步优化效率,IG-VLA包含一个场景精髓记忆(Scene Gist Memory),将推理得出的关联存储为紧凑的令牌,从而在推理过程中绕过显式的未来想象。在LIBERO和VLABench等基准测试上的实验表…
-
FastOPD框架通过蒸馏实现轻量级VLA模型部署
研究人员开发了FastOPD,一个用于部署轻量级视觉-语言-动作(VLA)模型的新框架。该方法使用On-Policy蒸馏将大型、计算成本高昂的VLA基础模型的知识转移到更小、更高效的学生模型中。FastOPD通过适配单状态教师监督的流图并结合自洽性目标来实现这一点,理论上使学生模型能够匹配理想的少步教师模型的性能。评估显示,在推理延迟和计算成本方面有显著降低,同时保留了原始模型性能的很高百分比,并且优于现有的蒸馏基线。
-
RIFAR 通过可靠性和漂移感知重放增强持续机器人学习
研究人员开发了 RIFAR,一种用于持续机器人学习的新方法,它解决了在不过度存储数据的情况下保留技能的挑战。RIFAR 结合了可靠性筛选和漂移感知重放选择来重建和选择相关的过去经验。该方法从演示前缀重建轨迹,并使用逆动力学模型来确保动作-视觉一致性。通过比较适应前后的动作预测,RIFAR 重新选择表现出显著漂移的轨迹,从而在 LIBERO-Goal 等基准测试中提高性能,同时保留最少数量的历史步骤。
-
新的EAPN方法增强了生成式机器人策略的一致性
研究人员开发了一种名为执行对齐渐进噪声(EAPN)的新方法,以提高生成式机器人策略在连续异步重规划过程中的一致性。EAPN通过在块间和块内级别引入结构化随机性来解决模式切换等问题,确保新的动作块与实际执行对齐并保持时间相关性。在D3IL、Kinetix、LIBERO、物体存储和双臂折叠布料等各种模拟和现实世界任务上的评估表明,即使在推理延迟很长的情况下,行为一致性和任务成功率也得到了显著提高。
-
条件轨迹峰值框架增强了多模态模仿学习
研究人员推出了一种新颖的单通道策略框架,称为条件轨迹峰值(CTP),专为多模态模仿学习而设计。CTP联合预测动作块候选、它们的概率质量和轨迹尺度,从而在重新规划周期中实现多样化和一致的行为。该框架结合了分布感知峰值专业化(DAPS)和证据门控轨迹信念传输(ETBT)来精炼轨迹峰值并保持跨块一致性。CTP在各种基准测试中表现出色,包括Push-T、D3IL Avoiding、Aligning、Sorting-2和LIBERO,实现了高成…
-
DiVeR 方法增强了 VLA 策略中的机器人动作选择
研究人员开发了 DiVeR,一种通过在测试时扩展中关注决策关键状态来改进视觉-语言-动作 (VLA) 策略的新方法。该方法通过将学习过程重新加权到对任务成功影响最大的动作选择状态,来解决机器人数据成本高昂的问题。DiVeR 根据采样动作表示的离散度来估计这种决策关键性,而无需逐步标注。在 LIBERO 和 RoboCasa 等模拟环境以及真实的 Franka Research 3 机器人上的实验表明,DiVeR 在最小的额外推理开销下…
-
FastOPD框架支持大型VLA模型的高效部署
研究人员开发了FastOPD,一个旨在通过降低计算成本来提高大型视觉-语言-动作(VLA)模型在现实场景中可部署性的新框架。该方法使用在线策略蒸馏,从大型教师模型训练一个更小、更高效的学生模型,在更少的推理步骤中保留显著的性能。实验表明,FastOPD可以显著降低推理延迟,同时在各种VLA模型甚至World Action Model上保持高成功率,证明了其在机器人和AI部署中的实用性。
-
新方法通过视频数据推进机器人策略学习 · 追踪4个来源
研究人员开发了训练世界动作模型的新方法,该模型可以预测未来的视觉动态和机器人动作。一种方法,RLA World Model (RLA-WM),利用源自 DINO 残差的新颖的残差潜在动作 (RLA) 表示,在效率和预测准确性方面优于现有的基于特征和视频扩散模型。另一种方法,NAVA-WAM,通过直接从仅观察视频预训练动作策略来引入原生动作先验学习,在各种设置中展示了强大的性能和泛化能力。第三个框架,WING,通过分离观察者引起的运动与…
-
生成克隆策略在处理多模态专家行为时遇到困难
研究人员调查了当专家行为是多模态的时,生成行为克隆所面临的挑战,这意味着单一观察可能导致多种有效行为。他们的工作揭示了潜在变量策略需要在其潜在表示中进行条件动作信息,以保留不同的模式,而过度的正则化会阻碍这一点。对于动作空间生成策略,多模态受到传输函数平滑度的限制,需要急剧的过渡或特定的桥接区域来覆盖多种模式。在合成和物理机器人任务上的实验证明了这些原理,尽管标准的机器人模拟基准显示出有限的条件多模态,而确定性回归通常表现具有竞争力。
-
新框架通过提高数据效率和鲁棒性来增强移动操作 · 跟踪4个来源
研究人员正在开发用于机器人移动操作的先进框架,旨在提高数据效率和鲁棒性。VOMMI 利用便携式演示和离线轨迹重建来增强具身智能的学习,与机器人收集的数据相比,速度误差有所降低。MobileVISTA 从规范演示中生成姿态扰动训练数据,提高了人形机器人等的鲁棒性,而无需生成模型。MobiAgent 采用双循环系统进行终身学习,将高级推理与低级控制分离,并在 BEHAVIOR-1K 和 RoboCasa 等基准测试中取得了显著的成功率提升…
-
新研究解决VLA模型敏感性、效率和可靠性问题
近期研究探索增强视觉语言动作(VLA)模型的可靠性和效率。一项题为“Rephrase Before You Act”的研究强调了VLA模型对指令措辞的敏感性,并提出了一个基于规则的系统,通过重写指令来缓解这一问题,显著提高了在分布外任务上的性能。另一篇论文“SpikingVLA”介绍了一个将人工神经网络转换为脉冲神经网络的框架,实现了具有竞争力的导航性能,同时显著提高了推理效率并降低了延迟。此外,“Sparse Feature Pol…
-
新的VLA模型增强机器人推理、安全性和效率 · 跟踪10个来源
研究人员正在为机器人技术开发先进的视觉-语言-动作(VLA)模型,重点是提高推理、安全性和效率。TOAST和TRUST等新方法旨在通过引入随机性和监控推理过程来增强策略学习和运行时安全性。其他进展包括用于城市导航的专用模型(UrbanVLA)、可泛化的奖励生成(Large Reward Models)以及节能的脉冲驱动架构。此外,还在努力改进VLA系统中的多智能体协调和长时任务规划。
-
新研究增强了机器人和AI的世界动作模型
近期研究探索了用于机器人和AI的世界动作模型(WAMs)的进展,重点是提高预测精度、动作生成和推理效率。几篇论文介绍了新的方法,如完成感知引导(CAG)以确保任务完成,回顾性世界建模以实现向后推理,以及动作经验字典(AED)以实现技能重用。其他工作通过诸如动作引导稀疏想象(Sparse-WAM)和带有阶梯策略的流式推理等技术来解决计算成本问题。这些创新旨在提高机器人控制、泛化能力和在复杂环境中的鲁棒性。
-
新方法使用优先目标引导生成式机器人策略
研究人员开发了一种新颖的方法,可以在推理时引导预训练的生成式机器人策略,使其在不改变策略权重的情况下遵循优先部署目标。该方法使用动态障碍物引导来确保在满足较低优先级目标的同时,不会增加较高优先级的成本。该方法在导航和操作基准测试中显示出更高的成功率和偏好合规性,优于现有基线,并在各种参数设置下表现出鲁棒性。