PulseAugur
实时 07:28:14

RayViT 通过相机几何增强机器人模仿学习

研究人员开发了 RayViT,这是一种新颖的架构,通过将相机几何信息整合到 Vision Transformer 模型中,增强了机器人的视觉模仿学习。该方法将以 Plücker 光线图形式表示的显式几何线索注入预训练的 ViT 主干网络。实验表明,RayViT 显著提高了对相机扰动的鲁棒性,在 RoboCasa 基准测试中提高了 13 个百分点,在现实世界任务中平均完成了 1.78 个阶段的改进。 AI

影响 通过将几何线索整合到视觉模型中,提高了机器人学习的鲁棒性。

排序理由 详细介绍新模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

RayViT 通过相机几何增强机器人模仿学习

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Qian Wang, Longrui Chen, Peiran Sun, Aleksandar Taranovic, Niklas Freymuth, Ge Li, Weiran Liao, C. F. Maximilian Nagy, Yucheng Tan, Tao Chen, Gerhard Neumann ·

    RayViT:用于视角鲁棒模仿学习的射线条件视觉表示

    arXiv:2607.29622v1 Announce Type: cross Abstract: Visual imitation learning enables robots to acquire visuomotor skills directly from images, yet RGB observations lack explicit geometric cues, making learned policies brittle to camera perturbations. To address this, we propose \t…