研究人员推出了一种新颖的引导深度超分辨率(GDSR)框架NAIMA,该框架利用了预训练视觉Transformer的语义先验。与依赖表面法线或分割图等解码预测的先前方法不同,NAIMA将未解码的语义Token嵌入直接注入深度恢复过程。这种方法利用引导Token注意力(GTA)模块,可以在单一重建损失下实现语义信息与深度数据的隐式对齐,从而提高性能和跨数据集泛化能力。 AI
影响 引入了一种利用视觉Transformer的语义信息来增强深度图分辨率的新颖方法,可能改进机器人和增强现实领域的应用。
排序理由 详细介绍图像处理新技术框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Guided Depth Super-Resolution
- Guided Token Attention
- NAIMA
- RGB color model
- Tayyab Nasir
- vision transformer
- ViT
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →