RoboTwin 2.0
PulseAugur coverage of RoboTwin 2.0 — every cluster mentioning RoboTwin 2.0 across labs, papers, and developer communities, ranked by signal.
- instance of LIBERO-Plus 95%
- developed by Fast-WAM 90%
- instance of Wamser 90%
- instance of Fast-WAM 90%
- used by World-Action Models 70%
- developed Fast-WAM 70%
- used by DM0.5 70%
- used by LingBot-VA 60%
- competes with World-Action Models 50%
- competes with LingBot-VA 50%
- developed by LIBERO-Plus 50%
- developed LIBERO-Plus 50%
10 天有情绪数据
-
新的DRIVE方法通过多样化的成功轨迹增强VLA策略的泛化能力
研究人员开发了一种名为DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization)的新方法,以提高视觉-语言-动作(VLA)策略的泛化能力。该技术利用强化学习显式地鼓励成功轨迹的多样性,而不是仅仅优化成功本身。在LIBERO-Plus、ManiSkill3和RoboTwin 2.0等基准测试上的实验表明,DRIVE平均将域外性能提高了5.3个百分点。在AgileX PiPE…
-
紧凑型机器人策略通过细粒度的视觉表示实现高性能
研究人员开发了CoRP,这是一种紧凑型机器人策略,其参数数量远少于现有系统,但性能却很高。研究强调,多任务操作策略的有效性在很大程度上取决于视觉表示,而不是参数规模或生成先验。CoRP证明,预训练、任务适应和压缩的表示对于紧凑型策略至关重要,在LIBERO和RoboTwin 2.0等基准测试中表现优于规模大得多的模型。
-
FastOPD框架通过蒸馏实现轻量级VLA模型部署
研究人员开发了FastOPD,一个用于部署轻量级视觉-语言-动作(VLA)模型的新框架。该方法使用On-Policy蒸馏将大型、计算成本高昂的VLA基础模型的知识转移到更小、更高效的学生模型中。FastOPD通过适配单状态教师监督的流图并结合自洽性目标来实现这一点,理论上使学生模型能够匹配理想的少步教师模型的性能。评估显示,在推理延迟和计算成本方面有显著降低,同时保留了原始模型性能的很高百分比,并且优于现有的蒸馏基线。
-
新方法通过视频数据推进机器人策略学习 · 跟踪4个来源
研究人员开发了训练世界动作模型的新方法,该模型可以预测未来的视觉动态和机器人动作。一种方法 RLA World Model (RLA-WM) 利用源自 DINO 残差的新型残差潜在动作 (RLA) 表示,在效率和预测准确性方面优于现有的基于特征和视频扩散模型。另一种方法 NAVA-WAM 通过直接从仅观察视频预训练动作策略来引入原生动作先验学习,在各种设置中表现出强大的性能和泛化能力。第三个框架 WING 专注于通过分离观察者引起的运…
-
GroundingPI模型利用视觉原语推进物理智能
研究人员推出GroundingPI,一个拥有40亿参数、专为物理智能任务设计的基础模型。该模型在精确物体定位方面表现出色,能够生成量化坐标点和边界框,这对于实时控制至关重要。GroundingPI在众多物体定位基准测试中取得了最先进的性能,超越了GPT-6 Astra等更大的模型。其有效性在机器人操作和自动驾驶等下游应用中得到了进一步证明,显著提高了性能,尤其是在分布外场景下。
-
新框架减少机器人代理Token使用量,提高成功率
研究人员开发了PyRUA-Lean,一个旨在优化视觉语言模型(VLM)控制的机器人代理效率的新框架。该框架通过组合机器人基元和选择性请求反馈来减少Token开销,从而显著减少了LLM调用和输入Token。在各种数据集的模拟中,PyRUA-Lean即使在LLM调用预算受限的情况下,也比传统的工具调用基线显示出更高的任务成功率。
-
Dream4ACT 模型将机器人动作建模与视觉界面统一
研究人员推出 Dream4ACT,这是一种新颖的世界模型,专为跨不同机器人载体的联合视频-动作建模而设计。该模型利用一个共享的视觉动作界面(称为“动作视图”)来统一动作表示,通过从多个虚拟摄像头渲染目标关节配置。Dream4ACT 采用视频自动编码器和扩散 Transformer,并使用掩码流匹配进行训练,以支持前向和逆向动力学以及联合观察-动作生成。该系统在 RoboTwin 2.0 和 TriWorldBench 等基准测试中表现…
-
新研究增强了机器人和AI的世界动作模型
近期研究探索了用于机器人和AI的世界动作模型(WAMs)的进展,重点是提高预测精度、动作生成和推理效率。几篇论文介绍了新的方法,如完成感知引导(CAG)以确保任务完成,回顾性世界建模以实现向后推理,以及动作经验字典(AED)以实现技能重用。其他工作通过诸如动作引导稀疏想象(Sparse-WAM)和带有阶梯策略的流式推理等技术来解决计算成本问题。这些创新旨在提高机器人控制、泛化能力和在复杂环境中的鲁棒性。
-
新方法提升机器人策略跨具身迁移能力
研究人员开发了一种新方法,用于提高机器人策略在不同具身间的迁移能力。通过使用动作相似性监督(训练潜在动作以匹配真实机器人动作的相似性),他们的方法与直接预测真实动作相比,显著增强了跨具身迁移能力。该技术在RoboTwin 2.0数据集上进行了评估,结果表明对末端执行器运动进行相似性监督可获得最佳性能。
-
新研究通过时间上下文和视觉前瞻性增强机器人操控能力 · 跟踪4个来源
研究人员正在开发新方法,通过结合时间上下文和视觉前瞻性来改进机器人操控。PACT-WAM 使用紧凑的时间编码来预测动作轨迹和视觉结果,在各种任务上实现了高成功率,尤其是在增强了提案审查组件后。同样,TEMPO 通过增加运动摘要和本体感受历史来增强现有模型,以解决运动模糊和状态别名问题,从而解决了动态操控的局限性。另一种方法“Acting in Meters”引入了一个度量交互框架,该框架在物理空间中对物体和场景交互进行建模,以优化动作…
-
具身智能模型DM0.5横扫四大关键基准,展现广泛能力
具身智能模型DM0.5在RoboColiseum基准测试(一个用于评估具身智能的综合平台)的四个子排行榜上均取得了最高排名。该模型是首个在指令遵循、空间理解、扰动适应和通用操作这四个类别中均表现出色的模型,显示出其没有结构性弱点。DM0.5的成功归功于其先进的架构,包括用于推理的具身思维链(embodied Chain-of-Thought)、用于空间理解的海量以自我为中心的视频数据,以及用于快速推理和长期记忆检索的工程优化,使其能够…
-
新的世界动作模型通过因果语义和多模态预测增强泛化能力
研究人员开发了新的世界动作模型(WAMs),它们在视觉分布变化下提高了泛化能力。第一个模型CSWAM集成了基于V-JEPA 2.1构建的因果语义专家,以更好地表示语义状态变化和运动,显著提高了真实机器人实验的成功率。第二个模型ModAR自回归地去除了RGB之外的多种未来模态的噪声,例如深度图和点轨迹,展示了在训练FLOPs显著减少且无需预训练的情况下性能更优。
-
新的CASD方法通过蒸馏语义目标来增强机器人操作能力
研究人员开发了一种名为分块对齐语义蒸馏(CASD)的新方法,以改进机器人操作任务。CASD使用离线视觉语言模型将演示分解为多个阶段,并为整个动作块(即使是跨越多个阶段的动作块)推导出语义目标。这种方法训练一个以这些预测为条件的策略,与现有方法相比,在各种基准测试和机器人集成中表现得到提升。
-
RoboCousin平台为双臂机器人操作生成多样化数据集
研究人员开发了RoboCousin,一个旨在为训练双臂机器人操作策略生成多样化数据集的仿真平台。该平台将用户提供的物体观察转换为可重用的仿真资产,包括几何形状、物理属性和交互数据。RoboCousin还可以构建具有不同物体、背景和指令的各种场景,能够为50项任务生成超过一百万条专家轨迹。实验表明,RoboCousin生成的合成数据与精心策划的标注相当,并且能有效地进行仿真到现实的迁移。
-
新框架通过验证世界动作模型预测来增强机器人控制能力
研究人员推出了一种名为世界相干解码(WCD)的新型框架,旨在提高机器人领域中世界动作模型(WAMs)的可靠性。WCD通过将WAM的滚动预测视为可测试的假设,采样多种未来场景,并在执行前根据视觉合理性和动作稳定性进行排序。这种自验证过程利用内部生成信号来预测可靠性,从而在RoboTwin 2.0基准测试等任务上取得改进的性能。
-
新的RoboPhys-3D基准评估具身AI世界模型
研究人员推出了RoboPhys-3D,一个旨在通过利用3D重建来评估具身AI世界模型的新基准。该基准建立在RoboTwin 2.0之上,包含50个操作任务,并使用统一的3D接地协议来评估生成的模拟是否能保持场景状态一致性并导致可执行的操作。通过将生成的视频和真实视频通过相同的3D重建管道进行处理,该评估区分了由重建引起的错误和由生成引起的错误。在测试的模型中,COSMOS 3020308取得了最高分,这凸显了对具身AI进行接地、面向执…
-
机器人通过Zero-WAM模型从人类视频中学习未见过任务
研究人员开发了Zero-WAM,一种新颖的因果视频-动作模型,旨在使机器人能够通过学习人类演示视频来执行未见过的操作任务。这种方法借鉴了大型语言模型的上下文学习,使用视频作为任务规范。为了克服数据稀缺问题,一个自动化流程生成了一个包含74.2K个人类-机器人上下文学习对的数据集。Zero-WAM在模拟中的七个未见过任务上取得了47.0%的成功率,显著优于现有的视频-动作模型,并在现实场景中展示了泛化能力。
-
元力觉醒DM0.5具身大模型达SOTA,已开源
元力觉醒的DM0.5模型在具身AI的RoboDojo基准测试中取得了最先进(SOTA)的性能,展现了卓越的记忆能力和19.34%的平均成功率。该模型在LIBERO和RoboTwin 2.0等其他评估中也表现出色,在包括人类模仿、精细操作和复杂环境稳定操作在内的多样化任务中展示了强大的泛化能力。元力觉醒已开源DM0.5模型、其训练框架及下游任务工作流,从而促进该领域的广泛研究与开发。
-
G0.5模型将机器人推理与行动整合到单一流中
研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。
-
RIFT 方法通过移除迭代视频推出,将机器人动作延迟削减
研究人员开发了 RIFT(Rollout-free Imagination via Future Tokens),一种用于世界动作模型(WAMs)的新颖方法,通过消除迭代视频推出显著降低了延迟。通过使用学习到的预期令牌在单次传递中构建未来的键/值缓存,RIFT 在机器人任务上保持了高成功率。这种方法在实现与传统的基于推出(rollout-based)的方法相当的性能的同时,大幅缩短了动作块(action-chunk)的延迟,并在 LI…