LIBERO-Plus
PulseAugur coverage of LIBERO-Plus — every cluster mentioning LIBERO-Plus across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新的SCVC方法在无需摄像头数据的情况下增强了机器人视点鲁棒性
研究人员开发了一种名为选择性跨视图一致性(SCVC)的新方法,以提高世界动作模型(WAMs)在处理摄像头视点变化时的鲁棒性。传统的WAMs在处理视点扰动时会遇到困难,而SCVC通过仅将一致性损失应用于动作和本体感觉等视点不变的元素,而不是像预测场景等视点共变的元素来解决这个问题。这种方法在训练或测试期间不需要摄像头信息,在未见过的轨道视点上显示出闭环成功率的显著提高。
-
新的 TOWN-VLA 接口通过控制提示权限提高机器人任务成功率
研究人员开发了一种名为 TOWN-VLA 的新提示-权限接口,以提高冻结的视觉-语言-动作 (VLA) 策略的性能。该接口将候选生成与修改策略输入的权限分开,防止了原始附加文本降低成功率的“提示形式崩溃”。TOWN-VLA 在模拟和物理机器人任务上都展示了更高的成功率,在 LIBERO-Plus 基准测试上的性能从 69.5% 提高到 73.1%,在物理 PiPER 机械臂上的性能从 52.7% 提高到 78.7%。
-
新框架FabriMAE增强VLA模型自我评估能力
研究人员开发了FabriMAE,一个新颖的视觉-语言-动作(VLA)模型自我评估框架。该框架名为马尔可夫注意力熵(MAE),利用内部视觉模态熵来评估动作生成的可靠性,而无需外部监督。MAE将内部注意力信号转换为架构感知的可靠性分数,在大量实验中表现优于现有基线。该框架在LIBERO-Reflect基准上进行了测试,并展示了对PI系列模型鲁棒性的改进。
-
新的ForeWAM模型在无需未来视频解码的情况下预测机器人动作
研究人员开发了ForeWAM,一种新颖的世界动作模型(WAM),它通过以预测的未来状态为条件来增强机器人动作生成,而无需显式进行未来视频解码。该方法利用了Future-KV机制,该机制处理当前的视觉信息和未来的随机槽以生成层级键值状态。这些状态在整个动作去噪过程中被重复使用,使模型能够捕捉由交互引起的过渡,如物体运动和任务进展。ForeWAM在LIBERO和LIBERO-Plus等机器人基准测试中取得了高成功率,证明了其在动态环境中的…
-
DFM-VLA 引入了用于机器人操作的迭代动作精炼
研究人员推出 DFM-VLA,一种利用离散流匹配迭代精炼动作令牌的新型机器人操作方法。与先前一次生成固定令牌的方法不同,DFM-VLA 对概率速度场进行建模,以动态更新整个动作序列。该系统集成了度量对齐动作分词器 (MAAT) 和两阶段解码策略,以提高预测精度。在各种数据集和实际任务上的实验证明了这种迭代精炼技术的有效性。
-
Faster-WAM 通过高效、通用的世界动作模型推进机器人操作 · 跟踪 3 个来源
研究人员开发了 Faster-WAM,一种新颖的世界动作模型(WAMs)方法,显著提高了机器人操作任务的推理速度和泛化能力。该方法在多篇 arXiv 论文中进行了详细介绍,引入了 Transformer 停靠(DoT)和稀疏未来条件框架等架构创新。这些进步使得 WAMs 即使在处理分布变化时,也能通过在没有高昂计算成本的情况下高效重用未来表示来保持性能和鲁棒性。实验表明,Faster-WAM 在 LIBERO 和 RoboTwin 2…
-
SG-WAM 框架学习用于机器人技术的几何感知动力学
研究人员开发了 SG-WAM,一个新颖的自导框架,用于在策略派生表示空间内直接学习几何感知、动作条件动力学。该方法将动作生成与未来状态预测相结合,解决了现有世界动作模型 (WAMs) 在平衡动作相关性与几何感知方面存在的局限性。SG-WAM 利用可学习的动力学令牌和自导世界预测器来预测未来的潜在状态,在 LIBERO 和 LIBERO-Plus 等机器人基准测试中取得了很高的成功率,而无需进行广泛的具身预训练。
-
新的世界-动作模型增强机器人操作和泛化能力
研究人员开发了几种新的机器人操作世界-动作模型(WAMs),旨在提高效率和鲁棒性。LiLa-WAM专注于轻量级潜在推理空间,可在单个GPU上进行端到端训练,在基准任务上取得了很高的成功率。ST-WAM通过使用具有DINOv3特征和历史检索的语义-时间建模,增强了在视觉分布变化下的鲁棒性,在真实世界场景中表现明显优于先前模型。LAWM-3D从人类视频中学习3D感知潜在动作,通过多视图不变性和几何对齐来提高世界模型性能。XEWorld引入…
-
新的Anchor-Align方法提升VLA策略泛化能力
研究人员推出了一种名为Anchor-Align的新方法,通过解决标准行为克隆(BC)微调的问题来改进视觉-语言-动作(VLA)策略。BC微调可能会降低预训练视觉-语言模型(VLM)的泛化能力。Anchor-Align通过两个目标增强BC:视觉-语言锚定,它使用来自冻结VLM的蒸馏来保留表示;以及语言-动作对齐,它在同一观察下联合训练语言和动作预测。这种方法在真实机器人成功率以及在模拟和物理xArm7机器人上的各种扰动鲁棒性方面都显示出显著的改进。
-
新方法增强VLM到VLA的适应性以实现机器人控制 · 跟踪2个来源
两篇新的研究论文提出了将视觉语言模型(VLM)适配为机器人视觉语言动作(VLA)模型的方法。第一篇论文介绍了CLAP(因果语言-动作预测),它将自然语言描述添加到动作序列中,以在微调过程中保持VLM的能力。第二篇论文Anchor-Align使用表示锚定和语言-动作对齐来防止预训练表示被覆盖并提高泛化能力。两种方法在机器人基准测试和物理机器人测试中都显示出显著的改进。
-
CorridorVLA 为生成式动作模型引入显式空间约束
研究人员引入了 CorridorVLA,一种新颖的视觉-语言-动作 (VLA) 模型方法,该方法显式地纳入了空间约束。与先前隐式嵌入空间指导的方法不同,CorridorVLA 将稀疏空间锚点预测为增量物理变化。这些锚点定义了一个容差走廊,通过走廊外的轨迹的校正梯度和走廊内的轨迹的精炼目标来指导动作生成过程。该方法在 LIBERO 和 LIBERO-Plus 等基准测试中取得了显著的改进,其中一个策略在多任务设置中实现了 83.21% 的成功率。
-
Reflective VLA 通过行动后果提高具身AI的泛化能力
研究人员推出了一种新颖的视觉-语言-行动(VLA)模型方法Reflective VLA,旨在提高具身控制任务的泛化能力。与仅依赖当前观察的反应式模型不同,Reflective VLA 整合了观察-行动-后果三元组的历史记录。这种上下文使模型能够更好地理解机器人校准和驱动偏差等部署特定因素。在标准和分布偏移环境中的实验表明,Reflective VLA 显著提高了成功率,尤其是在具有挑战性的跨环境泛化场景下。
-
Qwen-RobotManip 模型通过统一对齐技术推进机器人操作
研究人员开发了 Qwen-RobotManip,一个专为机器人操作设计的通用基础模型,该模型利用了统一的对齐框架。这种方法使模型能够有效地在包括人类视频和合成机器人轨迹在内的大规模、多样化数据集上进行训练,克服了以往异构操作数据的挑战。该模型展示了涌现的泛化能力,例如零样本指令遵循和跨具身迁移,在各种分布外基准测试中表现优于现有的最先进模型,并在真实机器人平台上展现出潜力。
-
ACE ROBOTICS 的 Kairos 世界模型树立了新的具身人工智能基准
ACE ROBOTICS 发布了其 Kairos 世界模型,该模型在四个主要的具身人工智能基准测试中取得了最高排名:RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot 和 DreamGen。该模型采用了一种新颖的统一架构,用于多模态理解、生成和预测,解决了现有视频生成模型的局限性。Kairos 已向行业开源。
-
GuidedVLA通过显式任务因子引导增强机器人动作控制
研究人员推出了一种新方法GuidedVLA,以增强机器人操作中视觉-语言-动作(VLA)模型的可控性和可解释性。该方法通过将任务相关因素分解为不同的组成部分来显式引导动作生成过程:目标定位、技能/阶段识别和空间几何。通过整合这些专门的注意力头,GuidedVLA在各种模拟和真实机器人任务中提高了性能,与传统的端到端VLA模型相比,提供了更强大、更易于理解的系统。
-
GEAR-VLA框架增强机器人操作泛化能力
研究人员开发了GEAR-VLA,一个旨在提高视觉-语言-动作(VLA)模型在机器人操作任务中泛化能力的新框架。该方法通过学习统一的、几何感知的动作表征来解决当前VLA模型的局限性。GEAR-VLA采用粗粒到细粒的学习策略,整合了具身预训练与连续动作专家,并将3D空间骨干网络与VLA表征对齐。该框架还纳入了具身规范化,以实现跨机器人泛化,在多个基准测试中展示了最先进的性能,并在涉及未知物体和不同机器人具身特性的任务中取得了高成功率。
-
VLANeXt模型为构建更强大的视觉-语言-动作模型提供配方
研究人员开发了VLANeXt,一种新的视觉-语言-动作(VLA)模型,通过系统地分析和优化设计选择,改进了现有架构。通过统一的框架和评估设置,他们确定了12个关键发现,这些发现构成了构建强大VLA模型的实用配方。VLANeXt在LIBERO和LIBERO-plus等基准测试中表现出色,并在实际应用中显示出有效性。该团队还发布了一个全面的代码库,以促进VLA领域的复现和进一步发展。
-
新的MoLA方法将机器人视频想象与动作执行相结合
研究人员开发了一种名为MoLA(潜在动作混合)的新方法,通过更好地利用预测的未来视频帧来改进机器人操作。MoLA采用预训练的逆动力学模型混合,将这些想象的未来转化为可执行的动作。该方法捕捉各种视觉线索以推断物理上合理的动作,从而弥合了视频生成与策略执行之间的差距。在模拟和真实世界任务上的评估表明,MoLA提高了任务成功率、时间一致性和泛化能力。