Vision Encoders
PulseAugur coverage of Vision Encoders — every cluster mentioning Vision Encoders across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的LoFi模型通过位置感知增强医学视觉基础模型
研究人员开发了一种新的医学视觉基础模型LoFi,旨在改进对临床有意义且空间一致的细粒度视觉表示的学习。该模型通过结合图像级语义监督和用于空间一致性的自监督学习来解决现有方法的局限性。LoFi利用轻量级大型语言模型和接地目标,在没有显式块级正则化的前提下实现空间一致性,在短语接地和视觉问答等任务中表现优于其他模型。
-
新的LAVIFT框架增强了VLM中的手术交互识别能力
研究人员开发了LAVIFT,一种用于微调视觉语言模型(VLM)以更好地识别手术交互的新型框架。该方法通过使用逆动力学模型来捕捉由动作引起的可视变化,以及使用前向世界模型将编码器聚焦于相关的动作区域,来解决将VLM应用于细粒度手术任务的挑战。LAVIFT包含一个补丁级别的SIG正则化器,无需额外监督即可防止特征坍塌,从而在实验中提高了识别和图像-文本对齐能力。
-
视觉编码器与人类颜色感知对齐度较弱
一项发表在arXiv上的新研究调查了常用于计算机视觉任务的深度视觉编码器是否表现出类似人类的颜色辨别阈值。研究人员使用受控的彩色刺激和区域重叠度量(mIoU)对超过50个预训练视觉编码器(包括卷积网络和视觉Transformer)与人类感知阈值进行了比较。研究结果表明,模型表征与人类阈值之间总体上对齐度较弱,表现最好的模型mIoU低于0.25。自监督编码器的表现优于监督式编码器,而语言监督模型的表现则差异很大。
-
视觉编码器共享通用几何结构
研究人员发现,无论其具体的训练目标或领域如何,现代视觉编码器内部都存在一种一致的几何结构,称为“跨架构基底”。这种基底是一个16维对象,在不同的视觉域中保持稳定,并且能够通过校准测试。这些发现表明,这些网络在处理视觉信息方面存在一个基本的不变性,从而在模型可迁移性和域检测等领域带来实际应用。