研究人员开发了 RayViT,这是一种新颖的架构,通过将相机几何信息整合到 Vision Transformer 模型中,增强了机器人的视觉模仿学习。该方法将以 Plücker 光线图形式表示的显式几何线索注入预训练的 ViT 主干网络。实验表明,RayViT 显著提高了对相机扰动的鲁棒性,在 RoboCasa 基准测试中提高了 13 个百分点,在现实世界任务中平均完成了 1.78 个阶段的改进。 AI
影响 通过将几何线索整合到视觉模型中,提高了机器人学习的鲁棒性。
排序理由 详细介绍新模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →