PulseAugur
实时 09:23:20
实体 RoboTwin 2.0

RoboTwin 2.0

PulseAugur coverage of RoboTwin 2.0 — every cluster mentioning RoboTwin 2.0 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 26
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 19
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/2 页 · 共 26 条
  1. TOOL · CL_198077 ·

    G0.5模型将机器人推理与行动整合到单一流中

    研究人员推出G0.5,这是一种新颖的自回归视觉-语言-行动(VLA)模型,它在一个Transformer解码器中整合了推理和行动生成。这种方法使VLM能够充当决策者,而不仅仅是上下文编码器。G0.5利用了一个可学习的行动分词器,用于共享的行动词汇表,一个用于交错推理和行动的思维链流,以及一个用于历史上下文的视觉记忆模块。该模型在七个不同的机器人基准测试中表现出最先进的性能,包括真实世界的机器人和长时程操作任务。

  2. TOOL · CL_198060 ·

    RIFT 方法通过移除迭代视频推出,将机器人动作延迟削减

    研究人员开发了 RIFT(Rollout-free Imagination via Future Tokens),一种用于世界动作模型(WAMs)的新颖方法,通过消除迭代视频推出显著降低了延迟。通过使用学习到的预期令牌在单次传递中构建未来的键/值缓存,RIFT 在机器人任务上保持了高成功率。这种方法在实现与传统的基于推出(rollout-based)的方法相当的性能的同时,大幅缩短了动作块(action-chunk)的延迟,并在 LI…

  3. RESEARCH · CL_186962 ·

    World-to-Wrist VLA模型通过未来手腕建模增强机器人操控能力

    研究人员开发了World-to-Wrist VLA (W2-VLA),一种新颖的视觉-语言-动作模型,专为精细机器人操控而设计。该模型独特地结合了任务条件化的未来手腕建模,使其能够预测手腕层面的交互如何在更广泛的任务背景下演变。W2-VLA利用潜在建模令牌接口和称为W2-CoT的合成管道来提供辅助监督,增强其预测未来动作的能力。实验表明,W2-VLA在操控精度方面有所提高,并保持实时动作生成速度。

  4. RESEARCH · CL_180810 ·

    Faster-WAM 通过高效、通用的世界动作模型推进机器人操作 · 跟踪 3 个来源

    研究人员开发了 Faster-WAM,一种新颖的世界动作模型(WAMs)方法,显著提高了机器人操作任务的推理速度和泛化能力。该方法在多篇 arXiv 论文中进行了详细介绍,引入了 Transformer 停靠(DoT)和稀疏未来条件框架等架构创新。这些进步使得 WAMs 即使在处理分布变化时,也能通过在没有高昂计算成本的情况下高效重用未来表示来保持性能和鲁棒性。实验表明,Faster-WAM 在 LIBERO 和 RoboTwin 2…

  5. TOOL · CL_174223 ·

    新的QuantWAMs框架优化世界动作模型以实现高效部署

    研究人员开发了QuantWAMs,一个用于量化世界动作模型(WAMs)的新颖框架,以提高其部署效率。与以前的方法不同,QuantWAMs根据模型的结构、部署分布和任务目标来校准量化决策。这种方法引入了共享基数异常值校准、联合训练目标显著性以及固定干预部署审计的策略。在包括真实机器人操作任务在内的各种基准测试上的评估表明,QuantWAMs在保持接近全精度模型的性能的同时,显著减少了内存使用并提高了速度。

  6. RESEARCH · CL_178565 ·

    新的世界-动作模型增强机器人操作和泛化能力

    研究人员开发了几种新的机器人操作世界-动作模型(WAMs),旨在提高效率和鲁棒性。LiLa-WAM专注于轻量级潜在推理空间,可在单个GPU上进行端到端训练,在基准任务上取得了很高的成功率。ST-WAM通过使用具有DINOv3特征和历史检索的语义-时间建模,增强了在视觉分布变化下的鲁棒性,在真实世界场景中表现明显优于先前模型。LAWM-3D从人类视频中学习3D感知潜在动作,通过多视图不变性和几何对齐来提高世界模型性能。XEWorld引入…

  7. SIGNIFICANT · CL_153037 ·

    灵机发布DM0.5具身大模型、机器人平台及开发工具

    灵机(Yuanli Lingji)发布了其自研的具身智能基础大模型DM0.5,旨在解决具身智能领域的碎片化和数据挑战。该模型拥有40亿参数,在5万小时真实机器人数据和10万小时场景视频上进行训练,展示了显著的零样本(zero-shot)和少样本(few-shot)学习能力提升,其中零样本导航成功率提升31%,少样本成功率提升45%,相较于前代产品。公司还推出了2.0-Apex通用具身机器人平台和DexDev开发者平台,集成了DFOL …

  8. SIGNIFICANT · CL_150746 ·

    新型机器人模型Riemann-1.0通过人类视频训练掌握家务 · 跟踪到1个来源

    Riemann Dynamics发布了其新型机器人模型Riemann-1.0,该模型在RoboCasa-365家务任务基准测试中取得了62.6%的新国家级最高分。该模型是昆仑万维的子公司,接受了超过232,000小时人类活动视频的训练,这与传统的机器人训练数据有显著区别。该方法整合了视觉语言模型(VLMs)和世界模型,利用人类视频数据让机器人对物理交互和任务规划有更直观的理解,然后再用具体的机器人数据进行微调。

  9. TOOL · CL_131470 ·

    新的MECo-WAM模型通过4D几何先验增强机器人操作能力

    研究人员开发了MECo-WAM,这是一种新颖的世界动作模型,旨在通过整合4D几何先验来增强机器人操作能力。该模型在不增加推理成本的情况下,将与动作相关的几何信息注入到视频-动作表示中。MECo-WAM采用多专家协同训练方法,包括一个轻量级的4D专家,并采用衰减的4D读掩码注意力和动作感知时间几何蒸馏等技术,以提高在LIBERO和RoboTwin 2.0等任务以及现实世界操作中的性能。

  10. TOOL · CL_128863 ·

    新的视觉运动策略框架实现了高保真单步机器人控制

    研究人员开发了一种新颖的单步生成式视觉运动策略框架,旨在改进机器人控制。该新方法结合了递归一致动作流(RCAF)来校正空间误差,双时间步频率一致性(DTFC)来保持精细操作细节,以及对比流匹配(CFM)来减少模糊动作。在各种机器人平台上进行的实验表明,该方法在仅需一次前向传播的情况下,实现了与多步方法相当的性能,从而实现了更低延迟的控制。

  11. TOOL · CL_121922 ·

    Self-Variable Robotics unveils X-Tokenizer for embodied AI action segmentation

    Zibianliang (Self-Variable) Robotics has introduced X-Tokenizer, a novel cross-modal embodied action tokenizer designed to improve the semantic understanding between visual-language models (VLMs) and robot action expert…

  12. TOOL · CL_96336 ·

    ACE-Ego具身模型在关键基准测试中达到SOTA

    来自GreatX Robot和香港中文大学MMLab的研究人员推出了一种新颖的具身操作VLA模型ACE-Ego。该模型采用“以人为中心”的训练范式,有效地结合了大规模第一人称人类视频和多机器人数据。ACE-Ego在RoboCasa GR1 TableTop和RoboTwin 2.0这两个主要的具身智能基准测试中取得了最先进的成果,在复杂的零售场景中展现出强大的泛化能力。

  13. RESEARCH · CL_95767 ·

    以人为中心的视频在具身AI预训练中优于机器人数据

    研究人员发现,与传统的遥操作机器人轨迹相比,以人为中心的视频可以作为一种更有效且成本效益更高的数据源,用于具身基础模型的预训练。研究表明,在过滤后的以人为中心的视频数据上训练的模型,在动作预测和任务执行方面取得了优于使用真实机器人数据训练的模型。这表明一种新范式,即使用多样化的人类视频数据进行初始预训练,然后用一小部分标记的机器人数据进行适应,以实现精确的动作对齐。

  14. SIGNIFICANT · CL_86720 ·

    ACE ROBOTICS 的 Kairos 世界模型树立了新的具身人工智能基准

    ACE ROBOTICS 发布了其 Kairos 世界模型,该模型在四个主要的具身人工智能基准测试中取得了最高排名:RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot 和 DreamGen。该模型采用了一种新颖的统一架构,用于多模态理解、生成和预测,解决了现有视频生成模型的局限性。Kairos 已向行业开源。

  15. RESEARCH · CL_91023 ·

    新型WAM4D模型通过4D空间感知增强机器人操控能力

    研究人员开发了WAM4D,一种新颖的4D世界动作模型,旨在通过整合3D空间约束来改进机器人操控。与之前在2D或潜在空间中运行的模型不同,WAM4D利用轻量级的空间寄存器令牌将几何先验知识转移到因果Transformer中。这种方法通过在训练后移除寄存器分支来实现高效的动作推理,而因果混合注意力则防止了非因果捷径。在RoboTwin 2.0数据集和真实世界任务上的实验证明了WAM4D在增强空间一致性和动作预测效率方面的能力。

  16. RESEARCH · CL_77215 ·

    GuidedVLA通过显式任务因子引导增强机器人动作控制

    研究人员推出了一种新方法GuidedVLA,以增强机器人操作中视觉-语言-动作(VLA)模型的可控性和可解释性。该方法通过将任务相关因素分解为不同的组成部分来显式引导动作生成过程:目标定位、技能/阶段识别和空间几何。通过整合这些专门的注意力头,GuidedVLA在各种模拟和真实机器人任务中提高了性能,与传统的端到端VLA模型相比,提供了更强大、更易于理解的系统。

  17. RESEARCH · CL_79104 ·

    GEAR-VLA框架增强机器人操作泛化能力

    研究人员开发了GEAR-VLA,一个旨在提高视觉-语言-动作(VLA)模型在机器人操作任务中泛化能力的新框架。该方法通过学习统一的、几何感知的动作表征来解决当前VLA模型的局限性。GEAR-VLA采用粗粒到细粒的学习策略,整合了具身预训练与连续动作专家,并将3D空间骨干网络与VLA表征对齐。该框架还纳入了具身规范化,以实现跨机器人泛化,在多个基准测试中展示了最先进的性能,并在涉及未知物体和不同机器人具身特性的任务中取得了高成功率。

  18. RESEARCH · CL_74409 ·

    机器人研究在操作、AI、安全和泛化方面取得进展

    研究人员正在开发先进的机器人操作方法,重点是提高泛化性、安全性和效率。BiCICLe 等新框架利用上下文学习来执行双臂任务,而 Ambient Diffusion Policy 和 GHOST 则增强了从次优或多样化数据中进行模仿学习的能力。其他方法,如 WorldDP 和 Latent Diffusion Policy,则使用分层结构和世界模型来处理复杂的多阶段任务。此外,PACT 和一项关于安全具身AI的调查,解决了机器人系统在物…

  19. RESEARCH · CL_80195 ·

    Light-WAM 模型通过高效的未来预测增强机器人操控能力

    研究人员开发了 Light-WAM,这是一种新颖的轻量级模型,专为高效机器人操控而设计。该模型将未来视频预测纳入其训练目标,使其能够编码时间结构以获得更好的表示学习。Light-WAM 利用紧凑的视频骨干网络和降采样潜在空间来降低训练成本和推理延迟,使其适用于实时应用。

  20. RESEARCH · CL_72162 ·

    Flash-WAM 为世界动作模型实现 23 倍的推理加速

    研究人员开发了 Flash-WAM,一个显著加快推理时间的世界动作模型新框架。传统模型需要许多去噪步骤,使得实时控制变得困难。Flash-WAM 采用模态感知步长蒸馏技术,适应视频和动作流独特的噪声特性。这使得单步推理过程成为可能,在 NVIDIA L40S 硬件上将延迟从 8 秒以上降低到 350 毫秒以下,提高了 23 倍。