roboTwin
PulseAugur coverage of roboTwin — every cluster mentioning roboTwin across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
RoboTwin simulation to integrate persistent scene state tracking within 90 days
The EvoScene-VLA paper demonstrates the benefits of maintaining an action-updated scene state for robot control. Given RoboTwin's role as a simulation benchmark, it is plausible they will integrate similar persistent scene state tracking capabilities to better evaluate and train VLA models that benefit from this feature.
RoboTwin to release enhanced simulation benchmark for VLA models within 60 days
Multiple recent papers (Robo-Dopamine 2.0, EvoScene-VLA, EXIMO, GS-VLA) highlight advancements in VLA models for robotics, with RoboTwin simulation benchmark mentioned as a testing ground. The increasing sophistication of these models suggests a need for a more robust and feature-rich simulation environment to keep pace. RoboTwin may soon release an updated version of their benchmark to accommodate these new capabilities.
VLA models are increasingly incorporating self-supervised and curriculum learning for improved sample efficiency.
The recent cluster evidence shows a clear trend towards self-supervised methods (fine-tuning VLA models with their own interactions) and curriculum learning (Robo-Dopamine 2.0's Signed-Hop Curriculum). This indicates a shift in VLA research to overcome data scarcity and accelerate learning in complex robotic tasks.
-
新方法微调机器人以实现多任务操作
研究人员开发了一种新颖的自监督方法,用于微调视觉语言动作(VLA)模型以执行机器人操作任务。该方法从 VLA 自身的零样本交互中生成额外的训练数据,使其能够从专家数据中学习新技能,同时保留其原始的指令遵循能力。在真实的 ALOHA 机器人和 RoboTwin 模拟基准上的实验表明,该方法能够实现具有更高样本效率的鲁棒多任务策略。
-
新方法对机器人视觉语言动作模型进行自监督控制微调
研究人员开发了一种自监督方法来微调视觉语言动作(VLA)模型,例如 $π_{0.5}$,以提高其在新机器人实体上的性能。该方法通过模型自身的零样本交互生成额外的训练数据,解决了硬件不匹配导致的性能下降问题。在 ALOHA 机器人和 RoboTwin 模拟基准上的实验表明,这种微调方案增强了多任务策略,在有效学习新技能的同时保留了原始的指令遵循能力。
-
新方法增强机器人领域 VLA 策略的效率和鲁棒性 · 跟踪 4 个来源
研究人员开发了新方法来提高机器人领域视觉-语言-动作 (VLA) 策略的效率和鲁棒性。一种方法 EXIMO 使用视觉-语言模型 (VLM) 作为规划器,将复杂任务分解为更小的步骤,从而实现更高效的微调和数据收集。另一种方法 GS-VLA 采用高斯溅射技术,在无需重新训练的情况下使冻结的 VLA 策略适应视角变化,显著提高了性能鲁棒性。此外,Prism-GRPO 通过纳入轨迹级别的执行质量分数来增强策略优化,减少了对大量机器人滚动的需求…
-
机器人世界模型通过动作流和行为生成取得进展 · 跟踪3 个来源
研究人员正在开发新的机器人世界建模和控制方法,重点关注生成未来如何反映动作。Hydra-0 使用动作流将机器人动作表示为像素运动,从而提高运动误差并实现零样本组合。WorldEcho 和 WorldSync 解决了在专家演示之外评估动作遵循的差距,其中 WorldSync 增强了动作遵循能力,并作为更可靠的策略改进模拟器。BehaviorWorldGen 通过生成周围智能体具有行为可信度的响应来闭合动作模型和世界模拟器之间的循环,从而…
-
EvoScene-VLA 通过持续场景状态增强机器人控制
研究人员开发了 EvoScene-VLA,一种新颖的机器人控制方法,可在控制调用之间维护一个由动作更新的场景状态。该方法将当前的视觉观察与先前的场景状态相结合,然后根据机器人的动作更新场景状态。该系统在模拟任务中表现出改进的性能,提高了平均成功率,并在真实机器人上显示出优越性。
-
Robo-Dopamine 2.0 通过历史感知奖励增强机器人操作
研究人员开发了 Robo-Dopamine 2.0,这是一种先进的过程奖励模型,旨在通过解决当前视觉-语言-动作 (VLA) 模型的局限性来改进机器人操作。该新模型结合了历史条件化和分布外 (OOD) 感知奖励,利用参考面板和观察到的滚动历史来更好地区分有效进展和任务无效失败。一种新颖的、具有转换感知重放的 Signed-Hop Curriculum 有助于学习,从而在视觉顺序一致性和下游强化学习任务(包括成功的现实世界插入)方面取得显著改进。
-
新研究整合世界模型以实现高效的具身AI控制
三篇新研究论文介绍了通过更有效地整合世界模型来增强具身AI控制的新方法。WorldSimProbe 专注于诊断动作条件世界模型的忠实度,确保其预测与物理现实一致。Enfold 提出一种将世界模型的生成计算内化到表示中的方法,显著降低了动作延迟。World Tokens 在训练过程中使用世界模型来改进动作预测,从而增强具身策略,并在推理时移除世界模型分支以保持高效部署。
-
DyPES-VLA模型增强了机器人跨不同具身的操作能力
研究人员推出了一种新颖的视觉-语言-动作(VLA)模型DyPES-VLA,旨在提高机器人跨不同具身的操作能力。该模型通过从多样化数据中学习共享动力学先验,并使用具身特定的专家混合(MoE)动作头,解决了当前VLA方法的局限性。这使得DyPES-VLA能够在无需手动转换动作格式的情况下,将共享先验转换为各种机器人的原生动作空间,并在LIBERO、RoboCasa-GR1和RoboTwin 2.0等基准测试中取得了最先进的性能。
-
Papers with Code 推出机器人研究中心
Papers with Code 推出了一个新的专门的机器人研究页面,整合了主要的基准测试、带有代码链接的趋势论文以及开源制品。该平台旨在提供该领域的全面概述,可视化基准测试随时间的进展并指示模型可用性。该计划寻求社区对其他基准测试、任务和功能的投入,以增强其覆盖范围。
-
FlowWAM论文提出将光流作为WAMs的统一动作表示
研究人员推出FlowWAM,一个利用光流作为世界动作模型(WAMs)统一动作表示的新框架。这种双流扩散方法将编码丰富的每像素位移的光流与RGB视频集成在一个共享的预训练视频生成器中。FlowWAM可以在策略模式下进行动作预测,或在世界模型模式下使用目标流序列指导未来的视频生成。该方法利用大规模、无动作标签的视频数据集进行预训练,在操作任务和世界建模基准测试中表现出改进的性能。
-
RoboDojo基准揭示AI机器人与人类表现的巨大差距
一项名为RoboDojo的新基准已发布,用于评估具身智能,包含42个模拟任务和18个真实世界机器人任务。该基准突显了当前AI模型与人类表现之间存在的巨大差距,在模拟环境中,最佳模型成功率仅为8.80%,在真实机器人上为12.8%,而人类的成功率分别为76.03%和100%。RoboDojo旨在为具身智能提供标准化和全面的评估,涵盖泛化能力、记忆、精度、长时序执行和开放式语义理解。
-
新的视觉运动策略框架实现了高保真单步机器人控制
研究人员开发了一种新颖的单步生成式视觉运动策略框架,旨在改进机器人控制。该新方法结合了递归一致动作流(RCAF)来校正空间误差,双时间步频率一致性(DTFC)来保持精细操作细节,以及对比流匹配(CFM)来减少模糊动作。在各种机器人平台上进行的实验表明,该方法在仅需一次前向传播的情况下,实现了与多步方法相当的性能,从而实现了更低延迟的控制。
-
新框架增强具身代理的复杂操作能力 · 跟踪2个来源
两篇新的研究论文介绍了一种使具身代理能够执行长时程操作任务的框架。Cortex 使用一种双向对齐的具身代理框架,并带有定制的规划接口,将高层视觉语言模型(VLMs)的可执行子任务计划传达给低层视觉语言动作(VLA)模型。ACE 是另一个框架,它采用零样本工作流推理来进行桌面操作,将代理推理与可执行技能以及用于适应动态环境和执行失败的多时间尺度记忆相结合。这两种方法都旨在克服当前模型在处理复杂、多步任务方面的局限性。
-
新模型通过整合视觉和状态来增强机器人操作能力
研究人员开发了几种新方法,通过更好地整合视觉信息与机器人的状态和动作来提高机器人操作能力。例如,GeoProp 是一种轻量级适配器,通过将机器人状态投影到图像平面并注入空间先验来对齐本体感觉和视觉。RoboDojo 提供了一个统一的模拟和真实基准,用于评估通用机器人操作策略在各种任务中的表现。DSWAM 引入了一种双系统方法,将世界动作模型执行器与视觉语言规划器相结合,以实现细粒度操作,而 DynaWM 使用专门针对动态物体操作的基于…
-
新研究增强了用于机器人和视觉推理的VLA模型
近期研究探索了增强用于机器人操作和通用视觉推理的视觉-语言-动作(VLA)模型。研究通过域随机化和照片级真实感渲染来研究模拟到现实的泛化能力,并提出诸如 Faithful Warm-Start 等方法,通过在强化学习前确保视觉保真度来提高VLM推理的稳定性。其他工作引入了置信度驱动的测试时强化学习,无需外部奖励即可实现自我改进,以及状态感知分词器,以更好地从离散代码中解码动作。此外,研究还检查了VLA模型中的架构冗余,发现语言骨干对于…
-
新的机器人策略模型增强了动作生成和效率
研究人员开发了新的机器人策略学习方法,提高了动作生成效率和准确性。LeaP(一种可学习的源先验)通过对本体感觉进行条件化来优化动作生成的起点,从而在操作任务上取得了显著的性能提升。LaWAM引入了潜在世界动作模型,该模型预测紧凑的潜在视觉子目标而非完整的视频帧,从而在保持高成功率的同时降低了计算延迟。几何动作模型(GAM)将几何基础模型重新用于语言条件操作,直接整合3D几何以实现更鲁棒、更高效的控制。
-
MaskWAM模型统一掩码以增强机器人控制
研究人员开发了MaskWAM,这是一种新颖的以物体为中心的世界-动作模型,旨在通过视频预测来改进机器人控制。通过使用Transformer混合模型将掩码整合为输入和预测,MaskWAM解决了当前模型中的空间瓶颈,减少了歧义和背景偏差。这种方法增强了语义监督,并提供了精确的空间锚定,从而在各种机器人任务上取得了显著的性能提升,包括那些具有模糊语言指令的任务。
-
Next Forcing 框架提升视频生成速度和准确性
研究人员推出了一种名为“Next Forcing”的新型多块预测框架,旨在增强自回归视频生成。该方法通过提供关于未来动态的明确信号来解决当前模型的局限性,从而实现更快的训练收敛和更高的准确性,尤其是在高帧率下。该框架还加速了推理,并展示了在生成的视频中更好地遵守物理定律。
-
新型机器人模型AHA-WAM解耦规划与执行
研究人员开发了AHA-WAM,一种新颖的异步世界-动作模型,用于机器人操作,通过解耦世界预测和动作执行来提高效率。该模型采用双扩散Transformer架构,一个Transformer作为低频世界规划器,另一个作为高频动作执行器。实验表明,AHA-WAM在机器人任务上取得了最先进的性能,包括比以前的方法快4.59倍。
-
新CUBic框架统一机器人双臂感知与控制
研究人员开发了CUBic,一个旨在通过统一感知与控制来改进机器人双臂操作的新框架。该方法学习共享表示,允许独立手臂动作和协调交互,克服了先前方法中手臂解耦或过度耦合的限制。CUBic集成了单向感知聚合、通过共享码本的双向协调以及用于感知到控制的统一扩散策略,在RoboTwin基准测试中表现出色。