研究人员开发了 JEPADepth,一种新颖的自监督单目深度估计框架,它整合了受 Image Joint-Embedding Predictive Architectures (I-JEPA) 启发的掩码预测表示学习目标。该方法在 DINOv3 Vision Transformer 编码器的表示空间中,用预测损失增强了传统的光度损失。该方法在 KITTI、Make3D 和 Cityscapes 等标准基准测试中,与最先进的基于 Transformer 的方法相比,表现具有竞争力,并且在零样本迁移场景中超越了强大的基于 CNN 的基线。 AI
影响 增强了计算机视觉任务的自监督学习技术,有可能提高从单个图像理解 3D 场景的能力。
排序理由 该集群包含一篇详细介绍自监督单目深度估计新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Cityscapes
- DINOv3
- I-JEPA
- JEPADepth
- Kitti
- Make3D: learning 3D scene structure from a single still image
- vision transformer
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →