Vision-Language Foundation Models
PulseAugur coverage of Vision-Language Foundation Models — every cluster mentioning Vision-Language Foundation Models across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
SAM3模型使用空间引导提升遥感影像光伏分割效果
一项新的研究论文评估了使用SAM3视觉语言基础模型对遥感影像中小规模光伏(PV)系统进行分割的不同提示策略的有效性。研究发现,与纯文本提示相比,空间引导显著提高了分割的准确性和鲁棒性。结合语义和空间线索的混合提示产生了最高的准确性和稳定性,证明了这些引导类型的互补性。该研究强调了可提示基础模型的数据效率,仅用几百个标注样本就能取得显著的性能提升,使其适用于数据受限地区的太阳能电池板测绘。
-
新基准和方法推动医学视觉语言模型发展
研究人员开发了新的基准和蒸馏技术,以提高视觉语言模型(VLM)在医学领域的性能。PathAgentBench 专注于评估 VLM 直接从全切片病理图像中获取和整合证据的能力,揭示了当前模型在证据获取方面存在显著的性能差距。同时,Med-OPD 引入了一种面向证据的在线策略蒸馏方法,以增强医学 VLM 对视觉证据的依赖,而非语言先验。此外,一个用于 PET/CT 报告生成的新越南语多模态数据集旨在提高 VLM 在低资源语言和功能成像任务…
-
新的FMMC框架利用合成数据和VLMs增强材料分类
研究人员开发了一个名为FMMC的新框架,以提高计算机视觉中材料分类的准确性。该方法通过整合两项关键创新来解决标注数据有限的挑战:一个用于生成具有材料特定标签的合成数据集的自动化流程,以及一种从视觉语言基础模型中提取知识的策略。FMMC框架使用这些合成数据和来自VLM的先验知识来微调预训练的视觉模型,在多个数据集上展示了显著的性能提升。
-
TGRIP框架使用文本引导语义进行自动驾驶预测 · 已追踪3个来源
研究人员推出了一种用于自动驾驶的新型框架TGRIP,通过整合语义信息来增强车辆实例预测。与以往仅依赖几何监督的方法不同,TGRIP利用视觉-语言基础模型生成语义丰富的鸟瞰图。该方法旨在通过提供明确的语义感知来提高模型处理复杂场景的能力,从而更准确地预测代理行为。在nuScenes数据集上的实验表明,TGRIP的表现优于现有的最先进模型。
-
新方法以有限数据增强无监督跨模态检索 · 跟踪4个来源
研究人员正在开发新的无监督跨模态检索方法,旨在提高效率并减少对大型手动标注数据集的依赖。论文提出了属性提示核哈希(APKH)和全局邻域对齐哈希(GNAH)等技术,这些技术利用视觉语言基础模型和有限的配对数据来构建紧凑、对齐的汉明空间。另一种方法UniCA引入了双向交叉注意力和正相似性损失,以实现更鲁棒的多模态检索,并在WebQA+等基准测试中取得了改进。
-
新的FusionRS数据集集成了RGB和红外图像,用于遥感视觉语言模型
研究人员推出了FusionRS,这是一个新颖的大规模数据集,旨在通过整合RGB和红外图像来推进遥感领域的视觉语言模型。现有模型主要关注RGB数据,忽略了红外图像中存在的宝贵信息,例如热结构和光照不变特征。FusionRS旨在通过提供带有相应场景和红外特定字幕的对齐RGB-红外图像对来弥合这一差距,从而能够训练双模态基础模型以增强地球观测理解。
-
新框架对齐视觉语言和纯视觉AI模型
研究人员开发了一个名为 GPUA 的新框架,以更好地将视觉语言基础模型 (VLM) 与纯视觉基础模型 (VFM) 对齐。该方法将 VFM 特征视为一种视觉语言,创建正交映射以将 VFM 空间转换为 VLM 语义空间。对齐过程保留了几何信息,并在不需要标签或模型参数更新的情况下弥合了模态差距。实验表明,GPUA 在最小的开销下增强了跨模型兼容性,并提高了下游任务的零样本性能。