RoboCasa
PulseAugur coverage of RoboCasa — every cluster mentioning RoboCasa across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
DiVeR 方法增强了 VLA 策略中的机器人动作选择
研究人员开发了 DiVeR,一种通过在测试时扩展中关注决策关键状态来改进视觉-语言-动作 (VLA) 策略的新方法。该方法通过将学习过程重新加权到对任务成功影响最大的动作选择状态,来解决机器人数据成本高昂的问题。DiVeR 根据采样动作表示的离散度来估计这种决策关键性,而无需逐步标注。在 LIBERO 和 RoboCasa 等模拟环境以及真实的 Franka Research 3 机器人上的实验表明,DiVeR 在最小的额外推理开销下…
-
新框架通过提高数据效率和鲁棒性来增强移动操作 · 跟踪4个来源
研究人员正在开发用于机器人移动操作的先进框架,旨在提高数据效率和鲁棒性。VOMMI 利用便携式演示和离线轨迹重建来增强具身智能的学习,与机器人收集的数据相比,速度误差有所降低。MobileVISTA 从规范演示中生成姿态扰动训练数据,提高了人形机器人等的鲁棒性,而无需生成模型。MobiAgent 采用双循环系统进行终身学习,将高级推理与低级控制分离,并在 BEHAVIOR-1K 和 RoboCasa 等基准测试中取得了显著的成功率提升…
-
机器人通过可重用代码库学习和迁移复杂策略
研究人员开发了一种让机器人学习和迁移闭环策略的方法。闭环策略是一套复杂的指令集,需要进行观测处理、状态管理和分支逻辑。通过将成功的策略实现视为可重用的软件存档,编码代理可以利用现有代码和模拟反馈为新任务生成和改进策略。该方法在源任务上的平均成功率从 28.3% 提高到 64.2%,在使用优化存档实现时,在九个新目标任务上实现了平均 57.0% 的成功率,显著优于未参考生成策略的性能。
-
新的SA-WAM模型将3D数据整合到机器人策略学习中
研究人员开发了一个空间感知世界动作模型(SA-WAM),该模型将3D几何信息整合到用于机器人策略学习的大规模预训练视频扩散模型中。该模型重新利用现有的视频扩散骨干网络来同时预测动作、RGB和深度,从而无需大量微调即可实现3D感知世界建模。SA-WAM在RoboCasa和LIBERO-Plus等基准测试中表现出最先进的性能,并在UR5机械臂上显示出强大的实际改进。
-
机器人模仿学习进展聚焦于遗忘和时间上下文
研究人员正在探索机器人模仿学习的新方法,重点关注如何基于人类演示有效地训练和管理策略。其中一种方法,在 arXiv 论文中有所详述,引入了“重新训练校准审计”来衡量演示遗忘,评估行为变化和已移除数据的残留证据。另一篇在 Hugging Face 上发表的论文介绍了“WorldToken”,一种时间优先序列建模技术,它将异构机器人观测融合到由因果 Transformer 处理的世界标记中,并在需要长期时间上下文的任务上证明了其有效性。
-
新的世界动作模型增强了游戏和机器人中的AI代理
研究人员正在开发新颖的世界动作模型(WAM),以提高AI代理在视频游戏和机器人中的性能。例如,GameWAM统一了视觉预测和动作生成,以实现原生的游戏控制,并以更少的动作展示了具有竞争力的结果。其他进展包括LAWA,它使用潜在动作在机器人中进行高效的未来想象;RISE,一个优化规划想象展开的自适应框架;4DGS-WAM利用4D高斯溅射进行以对象为中心的建模;以及GlanceWAM,它将想象与控制分离以实现实时推理。
-
Zetta智能体实现机器人自进化物理智能
研究人员推出了一种名为Zetta的新型闭环具身智能体,旨在增强机器人的物理智能。Zetta能够持续进化运行时评论员和恢复技能,从而实现以动作频率进行的实时决策。该方法在LIBERO-Pro和RoboCasa等机器人基准测试中取得了最先进的性能,实现了显著的推理加速,并表明自进化智能体可以扩展可靠的物理智能。
-
SpatialVAM模型提高机器人策略数据效率
研究人员推出了一种新颖的3D视频动作模型SpatialVAM,旨在提高机器人操作中的数据效率。与以往常常忽略空间或时间理解的先前方法不同,SpatialVAM同时预测空间感知的多视图热图视频和RGB视频。该方法将3D信息整合到视频基础模型中,对齐表示格式以实现更好的动作微调。实验表明,SpatialVAM在数据高效操作方面取得了最先进的性能,以显著更少的演示轨迹优于其他模型。
-
RayViT 通过相机几何增强机器人模仿学习
研究人员开发了 RayViT,这是一种新颖的架构,通过将相机几何信息整合到 Vision Transformer 模型中,增强了机器人的视觉模仿学习。该方法将以 Plücker 光线图形式表示的显式几何线索注入预训练的 ViT 主干网络。实验表明,RayViT 显著提高了对相机扰动的鲁棒性,在 RoboCasa 基准测试中提高了 13 个百分点,在现实世界任务中平均完成了 1.78 个阶段的改进。
-
新的IntentVLA框架通过意图建模改进机器人操作
研究人员开发了IntentVLA,一个用于机器人操作的新框架,解决了多模态模仿数据的挑战。该框架将最近的视觉观察编码为短视界意图表示,然后以此为条件生成动作块。IntentVLA旨在通过减轻模糊观察引起的块间冲突来提高回放稳定性,并优于现有的视觉语言动作(VLA)基线。IntentVLA的有效性在AliasBench、SimplerEnv、LIBERO和RoboCasa等多个基准测试中得到了证明。
-
新的SIR方法增强了机器人学习的可解释性和偏见检测能力
研究人员开发了一种名为结构化图像表示(SIR)的新方法,以提高机器人学习策略的可解释性。SIR利用场景图(SGs)作为中间表示,从图像派生的特征构建图,然后学习将其稀疏化为与任务相关的子图。这种方法使机器人的决策过程更加透明,并允许分析学习到的行为,揭示数据集的偏见。在RoboCasa数据集上的评估表明,与传统的基于图像的基线相比,SIR策略取得了更高的成功率。
-
新的SIR方法通过场景图增强机器人学习的可解释性
研究人员开发了一种名为结构化图像表示(SIR)的新方法,以提高机器人学习的可解释性。SIR利用场景图作为中间表示,从图像特征构建图,然后对其进行稀疏化以创建与任务相关的子图以生成动作。这种方法不仅提高了可解释性,而且在RoboCasa基准测试中也表现出优越的性能,成功率达到19.5%,而基于图像的基线为14.81%。学习到的稀疏图还可以作为分析模型行为和识别数据集偏差的宝贵工具。
-
通过逆向动力学预测改进用于世界建模的VLM
研究人员正在探索改进视觉语言模型(VLM)在世界建模方面的预测能力的方法。一个关键挑战是VLM在正向动力学预测(根据动作生成未来状态)方面存在困难,但在逆向动力学预测(描述状态之间的动作)方面更擅长。这种不对称性正被用于通过弱监督学习(来自标注数据)和推理时验证等技术来增强VLM的性能。这些方法旨在为具身AI应用创建更强大、更准确的世界模型,其中一些方法在图像编辑和策略评估方面显示出与最先进模型相媲美的结果。
-
DeepMind Intelligence 为人本学习具身 AI 获得融资
中国公司 DeepMind Intelligence 在成立第一年内就获得了数亿元人民币的融资。该公司专注于具身智能的“人本学习”方法,强调在行动前观察和理解物理世界。这一策略使其 PhysBrain 1.0 模型在包括 WorldArena 和 SimplerEnv 在内的五个国际基准测试中名列前茅,展示了比传统模仿方法更高的学习效率和适应性。
-
PhysBrain 1.0 从视频中提取物理常识用于机器人学习
研究人员推出 PhysBrain 1.0,这是一种通过从大规模人类自我中心视频中提取物理常识来增强机器人学习的新方法。该方法将视频数据转换为结构化的问答监督,然后用于训练视觉-语言-动作 (VLA) 模型。PhysBrain 1.0 在各种多模态 QA 和具身控制基准测试中表现出最先进的性能,尤其显示出强大的域外泛化能力。
-
StereoPolicy 通过立体视觉增强机器人操作
研究人员开发了 StereoPolicy,这是一个利用同步立体图像对来增强机器人操作的新框架。该方法加强了机器人的几何推理能力,克服了单目视觉的深度感知限制,而无需显式的3D重建或相机校准。StereoPolicy 可与现有的 VLA 策略集成,并在多个模拟基准和真实机器人实验中展示了持续的改进。
-
机器人学研究通过自适应执行和新基准推动世界动作模型发展
研究人员正在开发新方法以提高机器人学中世界动作模型(WAMs)的可靠性和效率。一种方法侧重于自适应动作执行,机器人根据预测未来与现实世界观察之间的一致性来调整其动作,从而减少不必要的计算。另一项开发引入了iWorld-Bench,这是一个全面的基准测试和数据集,旨在评估和统一跨感知和记忆等各种任务的交互式世界模型的测试。第三项研究强调了动作-状态一致性(超越视觉真实性)对于诊断WAMs可靠性的重要性,并提出了一种无价值共识策略来增强规划。
-
X-WAM模型通过异步去噪统一机器人动作和4D世界合成
研究人员开发了X-WAM,一个新颖的统一4D世界模型,旨在将实时机器人动作执行与高保真4D世界合成相结合。该框架通过预测多视图RGB-D视频并采用轻量级结构适应以实现高效的空间信息重建,解决了先前模型的局限性。通过采用异步噪声采样(ANS),X-WAM优化了生成质量和动作解码效率,从而能够执行实时机器人任务,同时产生卓越的4D重建。