LIBERO-Pro
PulseAugur coverage of LIBERO-Pro — every cluster mentioning LIBERO-Pro across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的 VPP2 模型增强了机器人动作预测和泛化能力
研究人员推出了视频预测策略 2 (VPP2),这是世界动作模型 (WAMs) 的一项进展,旨在提高在开放式环境中机器人运动预测和动作生成的准确性。VPP2 通过使用大规模、多样化的操作视频数据集进行预训练,并为其动作模块采用混合 Transformer 架构,解决了现有 WAMs 的局限性。实验表明,VPP2 在视频预测方面显著优于 Cosmos3-64B 等模型,并在现实世界的 ALOHA 操作任务以及 LIBERO-Pro、LIB…
-
新的RV-ICL方法通过分层视频学习提升机器人任务成功率
研究人员开发了递归视频上下文学习(RV-ICL),这是一种新颖的无需训练的方法,旨在提高LLM代理在机器人任务中的性能。该方法将演示视频转换为可导航的层次结构,使代理在任务执行过程中能够根据需要访问越来越精细的细节级别。通过关注抓取和释放等子事件,RV-ICL显著提高了成功率,在LIBERO-PRO基准测试上的性能从92.6%提升到96.5%,在LIBERO-Plus上的性能从86.7%提升到95.8%。
-
OpenRUA 使编码代理能够通过原生 ROS 2 接口控制机器人
研究人员推出 OpenRUA,一个新颖的系统,使现成的编码代理能够使用其原生 ROS 2 软件接口直接控制机器人。这种方法通过仅向代理提供终端访问,将机器人控制视为一个实时软件项目,从而绕过了对复杂、定制化工具的需求。OpenRUA 在 CaP-Bench 和 LIBERO-PRO 等基准测试中取得了很高的成功率,证明代理可以自发地开发视觉运动策略、处理感官输入,并在没有任务特定训练的情况下构建操作控制程序。
-
新框架减少机器人代理Token使用量,提高成功率
研究人员开发了PyRUA-Lean,一个旨在优化视觉语言模型(VLM)控制的机器人代理效率的新框架。该框架通过组合机器人基元和选择性请求反馈来减少Token开销,从而显著减少了LLM调用和输入Token。在各种数据集的模拟中,PyRUA-Lean即使在LLM调用预算受限的情况下,也比传统的工具调用基线显示出更高的任务成功率。
-
Knowin AI 获得超10亿元人民币融资,发力消费级具身智能
成立一年多的消费级具身智能公司Knowin AI在一年内完成了第五轮融资,融资金额达数亿元人民币,累计融资金额已超过10亿元人民币。公司正致力于将其GLOW生成式具身大模型从技术演示阶段过渡到面向家庭用户的易用型应用。本轮融资将用于扩充训练数据、推进KNOWIN-X1机器人硬件的量产以及吸引具身智能领域的顶尖人才。Knowin AI的GLOW模型在RoboDojo和Embodied Arena等基准测试中表现出潜力,公司目标是让机器人…
-
Knowin 推出 GLOW 框架,实现单次演示机器人学习
Knowin 推出了 GLOW,一个用于单次演示机器人教学的生成式具身学习框架。该系统允许家庭机器人通过观察一次人类演示来学习新任务。在评估中,GLOW 在 RoboDojo 上达到了 62.2%,在 LIBERO-Pro 上达到了 86.7%(在其自身的测试条件下)。
-
新研究旨在提升VLA模型的泛化能力和效率
研究人员正在探索新的方法来提高机器人领域中视觉-语言-动作(VLA)模型的泛化能力。一种方法是等变反事实训练(ECT),通过训练模型使用配对演示,其中相同的指令在不同场景下需要不同的动作,来解决指令-动作绑定失败的问题。该方法在真实机器人任务的成功率方面显示出显著的改进。另一个概念VLA-Dreamer提出将世界模型集成到VLA架构中,通过在嵌入空间而非像素空间预测未来状态来提高样本效率并实现短期规划。
-
Zetta智能体实现机器人自进化物理智能
研究人员推出了一种名为Zetta的新型闭环具身智能体,旨在增强机器人的物理智能。Zetta能够持续进化运行时评论员和恢复技能,从而实现以动作频率进行的实时决策。该方法在LIBERO-Pro和RoboCasa等机器人基准测试中取得了最先进的性能,实现了显著的推理加速,并表明自进化智能体可以扩展可靠的物理智能。
-
Together AI 将大型语言模型与机器人连接,提高任务完成率
Together AI 开发了一个将大型语言模型与机器人策略连接的系统,使机器人能够思考和移动。该集成显著提高了机器人任务完成率,在现实世界任务中的性能从 16.7% 提高到 97.3%,在使用 LIBERO-PRO 基准的模拟中从 12.8% 提高到 53.3%。
-
新的Anchor-Align方法提升VLA策略泛化能力
研究人员推出了一种名为Anchor-Align的新方法,通过解决标准行为克隆(BC)微调的问题来改进视觉-语言-动作(VLA)策略。BC微调可能会降低预训练视觉-语言模型(VLM)的泛化能力。Anchor-Align通过两个目标增强BC:视觉-语言锚定,它使用来自冻结VLM的蒸馏来保留表示;以及语言-动作对齐,它在同一观察下联合训练语言和动作预测。这种方法在真实机器人成功率以及在模拟和物理xArm7机器人上的各种扰动鲁棒性方面都显示出显著的改进。
-
新方法增强VLM到VLA的适应性以实现机器人控制 · 跟踪2个来源
两篇新的研究论文提出了将视觉语言模型(VLM)适配为机器人视觉语言动作(VLA)模型的方法。第一篇论文介绍了CLAP(因果语言-动作预测),它将自然语言描述添加到动作序列中,以在微调过程中保持VLM的能力。第二篇论文Anchor-Align使用表示锚定和语言-动作对齐来防止预训练表示被覆盖并提高泛化能力。两种方法在机器人基准测试和物理机器人测试中都显示出显著的改进。
-
NVIDIA ASPIRE 框架使机器人能够学习和复用技能
NVIDIA 推出了 ASPIRE,一个旨在克服传统机器人编程局限性的新型机器人框架。ASPIRE 采用自学习、持续学习系统,通过存储和复用成功的技能来编写和优化机器人控制程序。该框架利用带有持久技能库的协调器-执行器架构,使机器人能够从过去的经验中学习,并将这些经验应用于新任务,从而随着时间的推移提高效率和学习速度。在模拟中,ASPIRE 在 LIBERO-Pro 基准测试的长任务上展示了 31% 的零样本性能。
-
机器人通过玩耍学习技能,提高任务表现
研究人员引入了“玩耍式自主机器人学习”(Playful Agentic Robot Learning, RATs)系统,该系统使具身智能体在执行特定任务之前,通过自我导向的玩耍来学习技能。这种方法允许智能体提出新颖的探索性任务,编写和优化代码即策略程序,并将成功的执行提炼成可重用的技能库。实验表明,在玩耍过程中学到的技能显著提高了在LIBERO-PRO和MolmoSpaces等模拟环境下游任务上的表现,优于基线方法。这些学到的技能还可…