SPair-71k
PulseAugur coverage of SPair-71k — every cluster mentioning SPair-71k across labs, papers, and developer communities, ranked by signal.
-
ViT-Up 框架增强 Vision Transformer 特征上采样
研究人员开发了 ViT-Up,一个用于改进 Vision Transformer (ViTs) 中特征上采样的新框架。与依赖外部图像引导的先前方法不同,ViT-Up 使用中间 ViT 隐藏状态来构建查询,从而能够在任意坐标处进行特征预测,同时保持与骨干特征的对齐。这种方法旨在克服 ViTs 在密集预测任务中因在大网格上计算成本高而带来的局限性。
-
ViT-Up 框架增强 Vision Transformer 特征上采样
研究人员推出了一种名为 ViT-Up 的新颖框架,旨在增强 Vision Transformer (ViTs) 的特征上采样。该方法利用中间隐藏状态进行逐层查询构建,无需外部图像引导,从而避免了特征泄露和碎片化等问题。ViT-Up 能够预测任意连续图像坐标处的特征,从而在语义分割和深度估计等密集预测任务上获得更好的性能,并在 Cityscapes 和 SPair-71k 等基准测试中取得了显著的提升。
-
SEMAGIC框架学习语义一致的三维物体表示
研究人员推出SEMAGIC,一个旨在从野外单张图像中学习可变形三维物体表示的新框架。与以往侧重视觉可信度的方法不同,SEMAGIC通过确保顶点在同一物体类别的不同实例中保持一致的含义,从而优先考虑语义一致性。这通过特征级一致性损失和顶点索引条件变形过程来实现。该框架在语义对应方面表现出显著的改进,在基准测试中优于现有方法。
-
归一化匹配Transformer在图像关键点匹配方面创下新的SOTA
研究人员开发了归一化匹配Transformer (NMT),这是一种新颖的深度学习模型,旨在实现图像对之间高效且准确的稀疏语义关键点匹配。NMT集成了视觉骨干网络、几何特征细化和一个专门的Transformer架构,该架构在每一层强制执行单位范数嵌入。这种方法结合对比损失和超球面一致性损失,能够产生更具辨别力的关键点表示,并在PascalVOC和SPair-71k等基准测试中取得了最先进的性能。
-
MARCO模型以更好的泛化性和速度增强语义对应
研究人员推出MARCO,这是一种旨在通过解决现有双编码器架构的泛化限制来改进语义对应性的一款新模型。MARCO采用了一种新颖的训练框架,该框架结合了用于空间精度的粗到精目标和一种自蒸馏方法,以将监督范围扩展到标注区域之外。这种方法产生了一个比基于扩散的替代方案更小、更快的模型,同时在多个基准测试中取得了最先进的性能,尤其是在细粒度定位和泛化到未见过的数据方面。