PulseAugur
实时 08:34:56
实体 Vision Transformer Encoder

Vision Transformer Encoder

PulseAugur coverage of Vision Transformer Encoder — every cluster mentioning Vision Transformer Encoder across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_178568 ·

    RayViT 通过相机几何增强机器人模仿学习

    研究人员开发了 RayViT,这是一种新颖的架构,通过将相机几何信息整合到 Vision Transformer 模型中,增强了机器人的视觉模仿学习。该方法将以 Plücker 光线图形式表示的显式几何线索注入预训练的 ViT 主干网络。实验表明,RayViT 显著提高了对相机扰动的鲁棒性,在 RoboCasa 基准测试中提高了 13 个百分点,在现实世界任务中平均完成了 1.78 个阶段的改进。