PulseAugur
实时 07:48:48
English(EN) ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

新的ST-WAM模型增强了机器人应对视觉变化时的操作鲁棒性

研究人员开发了一个名为ST-WAM(语义-时间世界动作模型)的新模型,旨在提高机器人操作的鲁棒性,尤其是在面对视觉分布变化时。与依赖像素生成未来监督的前世界动作模型不同,ST-WAM利用DINOv3进行共享语义表示和历史检索,同时保留VAE动力学以进行细粒度控制。这种方法不需要额外的具身预训练或特定任务的注释,显著提高了在LIBERO和RoboTwin 2.0等基准测试上的性能,并显著提高了在视觉变化下的实际成功率。 AI

影响 通过提高对视觉变化的鲁棒性来增强机器人操作能力,有可能在各种环境中实现更可靠的自主系统。

排序理由 该集群描述了一篇详细介绍机器人新模型的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ST-WAM模型增强了机器人应对视觉变化时的操作鲁棒性

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li ·

    ST-WAM:视觉分布变化下的鲁棒操纵语义-时序世界动作模型

    arXiv:2607.28993v1 Announce Type: cross Abstract: World Action Models (WAMs) have emerged as a promising paradigm by jointly modeling robot actions and future visual dynamics. However, their reliance on pixel-generative future supervision can entangle action-relevant state transi…